
Hosted by Bear Liu · ZH
《BearTalk AI 简讯》是一档自动更新的 AI 科技播客,由 AI 制作,人类把关。每期约 15 分钟。
每周固定时间,BearTalk Agent 编辑部从 25 个经过精选的信源中采集内容:包括 Anthropic、OpenAI、Google DeepMind、Meta AI 等一线实验室的官方发布,Simon Willison、Ethan Mollick 等独立研究者的深度分析,以及 Hacker News、Reddit 等社区的一线讨论。候选内容经过多轮 AI 筛选、撰写和校对,最终提炼为 5 个值得认真对待的话题。
这档节目不追热点,不堆资讯。它只做一件事:在 AI 领域每天产出的海量内容里,找出真正影响你工作方式和思维方式的那几个信号。
音频由 Bear 的克隆音色朗读,每期约 15 分钟,适合通勤或晨间收听。
---
BearTalk AI Daily Notes is an AI and technology podcast, published every day. It is produced by the BearTalk Agent team and overseen by Bear Liu.
Each morning, the system collects content from 25 curated sources: official releases from leading labs including Anthropic, OpenAI, Google DeepMind and Meta
AI; in-depth analysis from independent researchers like Simon Willison and Ethan Mollick; and first-hand community discussion from Hacker News and Reddit.
The candidates go through multiple rounds of AI selection, writing and review, and are distilled into five topics worth your attention.
This show does not chase headlines or pile up information. It does one thing: find the signals that actually matter to how you work and think, from the flood of AI content published every day.
Each episode runs around 15 minutes, narrated in Bear's cloned voice. Good for commutes and morning routines.

本期内容这期节目把五件看似独立的事情串在一起:OpenAI 把效率收益让利给开发者、同一模型靠两个参数设置把基准分数翻三倍、Every.to 记录的那个凌晨代理自主发消息的真实场景、Ethan Mollick 提醒我们还在用 2024 年的方式使用 2026 年的工具,以及企业里多个 AI 代理之间无法互信的基础设施困局。听完你会发现,能力已经不是今天最难的问题,如何管理、审计、信任这些代理,才是接下来真正要面对的挑战。本期要点- GPT-5.6 推出 Luna、Terra、Sol 三个子模型,模型自我优化带来的效率收益直接折进 API 定价,批量调用成本可观下降- ARC-AGI-3 测试中,仅开启"保留推理上下文"和"压缩"两个参数,GPT-5.6 Sol 的成绩从只解第一关跃升至六关全通- OpenAI 内部已用 AI 代理维护自身基础设施,工程师的核心工作正在从写代码转向定义任务边界和审查代理行为- Ethan Mollick 按任务类型推荐工具而非按模型排名,核心判断是大多数人还在用 2024 年的方式使用 2026 年的工具- 企业多代理场景下,身份验证、权限控制和操作可追溯是最大瓶颈,五家创业公司正分别从不同层面修这个问题参考资料Advancing the price-performance frontier with GPT-5.6 — https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/How enabling two settings tripled our scores on the ARC-AGI-3 benchmark — https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/Inside OpenAI's Race to Reinvent Software Development for the Agent Era — https://every.to/An opinionated guide to which AI to use to do stuff: The Summer 2026 Edition — https://www.oneusefulthing.org/Enterprise AI agents can't talk to each other, can't be trusted with permissions, and can't be audited — 5 startups are already fixing that — https://venturebeat.com/---BearTalk 狗熊有话说播客,始于 2012 年。订阅地址:https://beartalking.com/page/podcast

本期内容AI 正在悄悄嵌入越来越多的基础流程:筛简历、跑评估、管提示词、做动效。本期五件事从不同角度切入同一个现实:当 AI 进入权力关系和生产流程,你对它的设置、管理和理解方式,直接决定了结果的质量。听完这期,你会对"AI 工作流里的细节"有更具体的感知。本期要点- 有求职者在简历里藏了白色提示词注入指令,专门针对 HR 用来初筛的 AI,这不是一个关于聪明的故事,而是 AI 开始介入权力关系的信号- Mistral 在 Studio 里推出提示词版本控制功能,核心逻辑是把提示词当生产代码管理,团队用 AI 的人应该尽早建立这个习惯- OpenAI 发现只需开启两个设置,GPT-5.6 Sol 在 ARC-AGI-3 上的得分就翻了三倍,评估框架本身就是性能的一部分- Ethan Mollick 更新了 2026 年夏季 AI 工具选型指南,最大变化是他明确说"用 AI"已经从对话模式转向了代理模式,所需技能也随之改变- Product Hunt 出现了开源 AI 动效工具 Premation,它指向一个更大趋势:AI 辅助正在让开源替代品重新具备挑战专业工具的可能性参考资料How enabling two settings tripled our scores on the ARC-AGI-3 benchmark — https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/Advancing the price-performance frontier with GPT 5.6 — https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/Your Prompts and Skills need a system of record(Mistral 官方博客,请在 mistral.ai/blog 搜索原文)An opinionated guide to which AI to use to do stuff — https://www.oneusefulthing.orgPremation on Product Hunt — https://www.producthunt.com---BearTalk 狗熊有话说播客,始于 2012 年。订阅地址:https://beartalking.com/page/podcast

本期内容今天五篇覆盖了从密码学到工作流、从零售 AI 战略到开源力量格局的完整切面。Anthropic 用 Claude 发现了人类密码学家几十年没找到的数学漏洞,这不只是一个研究成果,而是一个信号:AI 开始在原创智识领域做出贡献了。与此同时,OpenAI 内部的工程文化正在被 AI 代理重塑,而 Target 的 AI 负责人在大会上说了一句逆流而动的话:真正的竞争优势不在模型本身。听完这期,你对"AI 能做什么"和"AI 应该怎么用"会有更具体的判断框架。本期要点- Claude 在两个加密算法中找到了新的攻击路径,AI 开始在人类专家的核心领地做出原创贡献- Every.to 团队在探索把 AI 嵌进 Slack,让指令和输出都发生在你本来就工作的地方,而不是另开一个窗口- OpenAI 内部工程师的深度采访揭示:代理越能干,"何时该让人介入"的判断反而越难,这种判断力没法外包给 AI- Target SVP 说护城河在模型之外,是数据管道、使用流程和让员工知道什么时候不用 AI 的那套体系- Nathan Lambert 分析开源与闭源的能力差距已压缩到让原有商业逻辑失效的程度,蒸馏技术让这场竞争更加微妙参考资料Discovering Cryptographic Weaknesses with Claude — https://www.anthropic.com/research/discovering-cryptographic-weaknessesWhat If Slack Was Your AI Command Center — https://every.to/context-window/what-if-slack-was-your-ai-command-centerInside OpenAI's Race to Reinvent Software Development for the Agent Era — https://every.to/inside-openais-race-to-reinvent-software-developmentTarget SVP Says Its Real AI Moat Isn't the Models — It's Everything Built Around Them — https://venturebeat.com/ai/target-svp-says-its-real-ai-moat-isnt-the-modelsOpen Models Recap: More on Kimi K3, Qwen 3.8, Xi's WAIC Speech, Distillation, the Open-Closed Gap, and What's Next — https://www.interconnects.ai/p/open-models-recap---BearTalk 狗熊有话说播客,始于 2012 年。订阅地址:https://beartalking.com/page/podcast

本期内容AI 正在触碰几条过去认为很稳固的边界:密码系统的安全边界、职业分工的边界、专家与模仿者之间的边界。本期从 Anthropic 的密码学研究出发,结合 OpenAI 的职场数据、Opus 5 的发布逻辑、Farnam Street 的认知框架,以及 Product Hunt 上浮现的 coding agent 基础设施趋势,讨论一个共同的问题:当 AI 让越来越多的事情变得可触达,真正的护城河在哪里。本期要点- Anthropic 用 Claude 在受控环境中发现了 HAWK 和 AES 两个密码算法的新型攻击路径,AI 正在进入密码分析这类极度依赖数学直觉的领域- OpenAI 分析超过八十万条工作消息,发现接近一半的专业技能请求来自原本不该做这件事的人,职业边界正在被 AI 消解- Claude Opus 5 上线并成为 Claude Max 默认模型,性能接近旗舰级 Fable 5 但价格减半,Anthropic 把它定位为长期运行代理任务的日常模型- Farnam Street 的文章提醒:AI 特别擅长产出听起来像专家的文字,在这个时代,能对具体案例给出可验证判断的能力,是真正的稀缺资产- Product Hunt 今天同时出现多个 coding agent 配套工具,包括跨会话记忆和完整开发流程编排,说明 coding agent 已从实验工具演变为需要基础设施支撑的产品类别参考资料How AI is expanding what people do at work — https://openai.com/index/how-ai-is-expanding-what-people-do-at-work/Introducing Claude Opus 5 — https://www.anthropic.com/news/claude-opus-5Experts vs. Imitators — https://fs.blogTask Monki — https://www.producthunt.comMemoryCustodian — https://www.producthunt.comDenovo — https://www.producthunt.com---BearTalk 狗熊有话说播客,始于 2012 年。订阅地址:https://beartalking.com/page/podcast

本期内容这期谈的五件事,围绕着一条主线:AI 能力的边界在哪里,谁来决定这条线。Claude Opus 5 的发布说明性价比的天花板在抬高;OpenAI 的研究数据揭示 AI 正在改变"谁做什么工作"而不只是"怎么做工作";Ethan Mollick 最新指南提醒我们,判断框架比工具清单更重要;MirrorCode 基准测试第一次认真问了一个问题:AI 能不能在看不到源码的情况下重建整个程序;Dario Amodei 公开说清楚了 Anthropic 对开放权重模型的真实立场。听完这期,你会对"AI 能做什么、不能做什么、谁有权决定"有更清晰的框架。本期要点- Claude Opus 5 成为 Claude Pro 最强选项,能力接近旗舰级但价格只有一半,性价比的阶梯往上跳了一格- OpenAI 分析逾八十万条用户消息发现,AI 正让人们跨越职位边界去完成原本属于其他职能的任务- Ethan Mollick 更新 2026 夏季 AI 工具指南,核心判断是:代理系统已经改变了"用 AI"的定义,工具调用和执行稳定性比模型聪明与否更关键- MirrorCode 基准测试让 AI 在看不到源码的情况下从零重建完整程序,顶级模型能完成部分任务,但最难的系统级任务仍未被攻克- Dario Amodei 公开说明 Anthropic 支持开放权重但基于风险程度分级,不是非此即彼,而是能力越强发布门槛越高参考资料Introducing Claude Opus 5 — https://www.anthropic.com/news/claude-opus-5How AI is expanding what people do at work — https://openai.com/index/how-ai-is-expanding-what-people-do-at-work/An opinionated guide to which AI to use to do stuff(Ethan Mollick / One Useful Thing)— https://www.oneusefulthing.orgMirrorCode: What's the largest software project AI can complete on its own?(Import AI #466)— https://epoch.ai/MirrorCodeOur position on open-weights models(Dario Amodei)— https://www.anthropic.com/news/open-weights-position---BearTalk 狗熊有话说播客,始于 2012 年。订阅地址:https://beartalking.com/page/podcast

本期内容今期围绕一个核心问题展开:AI 正在独立承担多大规模的工程任务?从 Bun 运行时被 AI 在十一天内完整重写,到 MirrorCode 基准测试衡量 AI 能独立完成多大的软件项目,再到 Claude Opus 5 被明确设计为可以"长时间自主运行的代理模型",这些事件合在一起指向同一个方向:AI 正在越过你以为它还进不去的边界。本期还有 Ethan Mollick 给出的工具选用判断,以及一篇关于 token 中转站黑市供应链的深度调查,帮你看清楚这套系统背后真实的钱和风险。本期要点- Claude Opus 5 正式发布,定位为日常主力,价格是旗舰的一半,专门针对需要长时间自主运行的代理任务调优- MirrorCode 基准测试要求 AI 只凭外部行为描述就从零重写完整软件项目,当前最强系统可完成中等难度任务,最难的还做不了- Bun 运行时被主维护者借助 Claude Code 在十一天内用 Rust 完整重写,API 费用十六万五千美元,随后合并进主分支- Ethan Mollick 发布 2026 夏季 AI 工具选用指南,核心判断是:现在区分用户水平的不再是会不会用,而是有没有让 AI 在没人看着时替你做事- Token 中转站黑市的供应链调查:一篇站主视角、一篇安全工程师视角,描述的是同一套系统,每一个灰色市场的存在都说明正规通道有道没解决好的门参考资料Introducing Claude Opus 5 — https://www.anthropic.com/news/claude-opus-5MirrorCode: What's the largest software project AI can complete on its own? — https://epoch.aiHow is the Bun Rewrite in Rust Going? — https://lockwood.devAn Opinionated Guide to Which AI to Use to Do Stuff: The Summer 2026 Edition — https://www.oneusefulthing.orgAn Inside Look at the Relay Market Powering Token Resellers and Fraud — https://vectoral.xyz---BearTalk 狗熊有话说播客,始于 2012 年。订阅地址:https://beartalking.com/page/podcast

本期内容AI 越来越便宜、越来越能干,但这件事的真正含义远不止"效率提升"。本期从五个角度拆解同一个核心问题:当职业边界开始模糊、模型成本大幅下降、AI 能独立完成完整软件项目,我们作为工作者和创作者,应该把自己放在哪里。无论你是产品人、设计师还是开发者,今天的内容都直接关系到你下一步该怎么调整自己的工作方式。本期要点- OpenAI 研究发现,近半数职业专属任务正被跨岗位的人用 AI 完成,"谁来做这件事"正在重新定义- Claude Opus 5 定位为每天可用的旗舰模型,价格是最强版本的一半,目标是消除用户的性价比心理负担- 微软发布两款自研 AI 模型,实测成本比 OpenAI 同类能力最多低八成九,AI API 市场正在走向分层竞争- MirrorCode 基准测试评估 AI 能否从零重写完整程序,中等规模项目已可独立完成,最难任务尚未攻破- Benedict Evans 分析 token 定价逻辑,指出算力供应紧缺状态不稳定,AI 能否变成低利润商品基础设施仍是未知数参考资料How AI is expanding what people do at work — https://openai.com/index/how-ai-is-expanding-what-people-do-at-work/Introducing Claude Opus 5 — https://www.anthropic.com/news/claude-opus-5Microsoft launches new in-house AI models it says cut costs up to 89% versus OpenAI — https://venturebeat.comImport AI #466: MirrorCode benchmark — https://importai.substack.comWays to think about token pricing — https://www.ben-evans.com---BearTalk 狗熊有话说播客,始于 2012 年。订阅地址:https://beartalking.com/page/podcast

本期内容OpenAI 分析了超过八十万条工作消息,发现近一半的职业特定任务正在被 AI 带到边界之外,这不是关于"哪些工作会消失"的老话题,而是关于谁能主动扩张自己的边界。本期五件事从数据、成本、模型、工具选用、编程能力测量五个维度,勾勒出 AI 正在重塑工作方式的真实图景。听完你会有一套具体的判断框架,知道现在该评估什么、该动手试什么。本期要点- OpenAI 分析八十万条工作消息:近 44% 的职业特定任务跨越了职业边界,AI 正在把每个人变成多面手- 微软发布自研 MAI 模型,图像和语音任务成本最高比 OpenAI 低 89%,AI 竞争进入运营效率阶段- Anthropic 发布 Claude Opus 5,定位为"每天都值得用的有推理能力的模型",成为 Claude Pro 最强默认选项- Ethan Mollick 更新 2026 夏季 AI 工具选用指南,核心判断:代理 AI 的崛起是质变,不是渐进进化- Epoch AI 和 METR 联合发布 MirrorCode 基准测试,测量 AI 能独立完成多大规模的完整编程项目参考资料How AI is expanding what people do at work — https://openai.com/index/how-ai-is-expanding-what-people-do-at-work/Introducing Claude Opus 5 — https://www.anthropic.com/news/claude-opus-5MirrorCode 基准测试(Epoch AI) — https://epoch.ai/MirrorCode---BearTalk 狗熊有话说播客,始于 2012 年。订阅地址:https://beartalking.com/page/podcast

本期内容AI 进入基础设施阶段意味着什么?这期节目用五个角度来回答这个问题:用户在替代哪些付费工具、专家建议你怎么选模型、开源模型的政策风险在哪里、ChatGPT 开始读你的健康数据、Claude Opus 5 重新定义日常可用的最强模型。听完这期,你会对"AI 能替代什么、替代不了什么"有一个更清晰的判断框架。本期要点- Reddit 上几百个真实用户列出了他们用 AI 替代的付费工具,结论是:AI 替代的是判断,替代不了流程和协作数据- Ethan Mollick 给出了 2026 夏季 AI 工具选择指南,核心结论是提示词质量和任务设计比选哪个模型更重要- 英国 AI 安全研究所数据显示,开源模型在网络安全能力上和闭源模型的差距正在快速收窄,政策窗口开始收紧- ChatGPT Health 在美国正式上线,可接入 Apple Health 和电子健康档案,帮用户追踪数据变化和整理就诊问题- Anthropic 发布 Claude Opus 5,价格与上代持平但性能大幅提升,成为 Claude Pro 和 Claude Max 的新默认主力模型参考资料Launching Health in ChatGPT — https://openai.com/index/health-in-chatgpt/Introducing Claude Opus 5 — https://www.anthropic.com/news/claude-opus-5An Opinionated Guide to Which AI to Use to Do Stuff (One Useful Thing) — https://www.oneusefulthing.orgHow Far Behind the Frontier are Leading Open Weight Models on Cyber (UK AISI) — https://www.gov.uk/government/organisations/ai-safety-instituteReddit r/ClaudeAI 讨论:AI 能替代的最贵订阅应用 — https://www.reddit.com/r/ClaudeAI/---BearTalk 狗熊有话说播客,始于 2012 年。订阅地址:https://beartalking.com/page/podcast

本期内容这一期的五个话题,表面上是五件独立的新闻,背后有一条共同的线索:AI 的能力在加速跑,但我们理解和使用它的方式还没跟上。从 Anthropic 重新定义旗舰模型的定价逻辑,到开源模型的安全边界收窄,再到一个独立博主对"AI 写代码时代软件质量下滑"的冷静观察,这期节目想帮你在集体亢奋里保留一点清醒的判断。本期要点- Claude Opus 5 正式上线,定价是顶配 Fable 5 的一半,专为长时间 Agent 任务设计,能力差距远小于价格差距- OpenAI 推出 ChatGPT Health,可连接 Apple Health 和医疗记录,让 AI 回答健康问题时调用你的真实数据- Ethan Mollick 更新 2026 夏季 AI 工具选型指南,核心逻辑是场景优先于跑分,并指出工作预期本身需要升级- 英国 AI 安全研究所研究显示,开源模型在网络安全能力上正快速追上闭源模型,政策讨论需要赶上技术现实- 独立博主 Piotr Chmielowski 指出,AI 生成的代码"能跑但无人理解"正在让软件系统变得更脆,这个问题还没有被认真处理参考资料Introducing Claude Opus 5 — https://www.anthropic.com/news/claude-opus-5Launching Health in ChatGPT — https://openai.com/index/health-in-chatgpt/An Opinionated Guide to Which AI to Use to Do Stuff (Ethan Mollick / One Useful Thing) — https://www.oneusefulthing.orgHow Far Behind the Frontier are Leading Open Weight Models on Cyber (Import AI #465) — https://importai.substack.comNothing Works and Everyone Is Euphoric (Piotr Chmielowski) — https://ptrchm.com---BearTalk 狗熊有话说播客,始于 2012 年。订阅地址:https://beartalking.com/page/podcast