Agili 的 AIGC 周刊(Y26W23)
本周 AI 圈只有一个主角:Claude Fable 5。Anthropic 发布这个首个面向公众的 Mythos 级模型,让一整批亲历者用「巫师变赞助人」「提示词工程变成园艺」这样的比喻来描述自己的震惊。然后,发布仅三天,美国政府以一纸出口管制令叫停了全部外国公民的访问权限。从技术奇迹到地缘政治事件,本周浓缩了 2026 年 AI 行业的所有矛盾。
模型发布与前沿技术
Claude Fable 5 和 Mythos 5:Anthropic 发布首个公开 Mythos 级模型
6 月 9 日,Anthropic 扔下了一颗重磅炸弹。Claude Fable 5 是首个通过安全审查后向公众开放的 Mythos 级模型,在软件工程、科学研究、视觉理解和生命科学领域全面碾压前代。Stripe 用它把数月工程工作压缩到数天,仅凭截图就能重建完整 Web 应用源码,药物设计速度提升 10 倍。
定价方面,每百万输入 token 10 美元、输出 50 美元,远低于此前 Mythos Preview 的价格。同步面向网络安全防御者发布的 Mythos 5 与 Fable 5 同源但解除了部分安全限制。HN 获得 2593 分,毫无悬念地登顶。
美国政府以国家安全为由要求 Anthropic 暂停 Fable 5 和 Mythos 5 访问
发布仅三天后,美国政府在 6 月 12 日发布出口管制指令,禁止所有外国公民访问这两款模型,Anthropic 被迫全面暂停。工程师们迅速将此事重新定义为「模型主权风险」而不仅是政策问题——依赖单一封闭前沿 API 的团队突然发现自己站在了地缘政治断层线上。
同期,Moonshot 开源了 Kimi K2.7-Code(1T 参数 MoE 编码模型),MiniMax 发布了 M3 开源多模态模型,华为宣布将开源 openPangu 2.0。开源替代的叙事在这一周获得了前所未有的紧迫感。
What It Feels Like to Work with Mythos — Ethan Mollick 独家深度评测
沃顿教授 Mollick 获得了 Fable 5 早期访问权限,做了一套极为严谨的测试。模型连续工作十余小时,在构建等时线地图项目时自主启动了多个子 Agent,检索了超过 2200 条航班数据——包括 TGV 到新干线的铁路时刻表和多国道路速度学术论文。
他最核心的洞察是一个隐喻:人类角色从「巫师」变成了「赞助人」。你不再写咒语,而是描述需求、付费、评判结果。施法发生在你看不到的地方,在数百个你永远无法投票的小决策中。Mollick 同时提出了担忧——模型对最轻微的安全暗示就会降级到 Opus 4.8,而且 AI 仍然以同样奇怪的风格写作。
DiffusionGemma:Google 发布 4 倍加速的扩散式文本生成模型
Google DeepMind 本周拿出了另一条技术路线。DiffusionGemma 摒弃了传统自回归逐 token 生成的「打字机」模式,改用扩散方式一次生成 256 个 token,速度提升 4 倍。
这个 26B MoE 架构的模型激活参数仅 3.8B,量化后 18GB VRAM 的消费级 GPU 就能跑。Apache 2.0 开源。它支持双向注意力和智能自我纠错,对需要低延迟的端侧应用来说是条全新的路。
Claude Fable 5 Is Relentlessly Proactive — Simon Willison 深度体验
Simon Willison 只给了 Fable 5 一张截图和一条简单提示,然后看着它自动完成了 11 步操作:启动本地服务器、打开 Playwright 浏览器、编写 HTML 测试页面、注入 JavaScript、搭建 CORS 服务器、通过 Shadow DOM 获取数据,最终找到并修复了 CSS bug。整个会话花费约 $12.11 的 API 费用。
他随后写了一句分量很重的话:这种自主能力如果被恶意指令劫持,将是「挑战者号灾难级别」的安全事件。HN 上 756 分、654 条评论的讨论热度说明很多人有同感。
Kimi K2.7-Code:Moonshot 发布 1T 参数开源编码模型,Token 效率提升 30%
中国开源阵营本周也交了一份答卷。月之暗面发布了基于 K2.6 改进的 Kimi K2.7-Code,1T MoE 架构、384 专家、激活 32B,推理 token 使用量减少了约 30%。支持「思维保留」多轮交互、图片和视频输入,Kimi Code Bench v2 得分 62.0,MCP Atlas 达 76.0。
Modified MIT 许可开源,支持 vLLM、SGLang、KTransformers 等推理引擎。在 Fable 5 被出口管制的背景下,这类高质量开源替代的价值正在被重新评估。
Gemini 3.5 Live Translate:70+ 语言近乎实时的语音到语音翻译
Google 发布 Gemini 3.5 Live Translate,支持 70+ 语言的实时语音翻译,保留说话者的语调、节奏和音高,仅落后数秒。不再是「等一句翻一句」——它能持续生成语音流,听感上接近自然对话。
已通过 Gemini Live API 向开发者开放公测,后续将集成 Google Translate 和 Google Meet。保留说话者语调这一点让跨语言沟通不再像机器转述,对全球化团队和旅行者是实打实的体验升级。
AI 编程与开发者工具
Stripe「Minions」:每周 1000+ PR 的端到端无人值守编码 Agent 系统
这是本周最扎实的工程实践分享。Stripe 公开了内部编码 Agent 系统 Minions:从 Slack 线程发起,自动读取上下文、创建分支、推送代码、跑 CI、按模板生成 PR。背后接入 400+ 内部 MCP 工具,每周超过 1000 个合并 PR 由 Minions 从头到尾生成,人类只负责 Review。
Stripe 的思路很清晰——把创意生成交给 LLM,把必须可靠的步骤交给确定性工具链。在一个拥有数亿行代码库、万亿级支付规模的环境里跑通这套系统,对任何想做大规模 AI 编码部署的团队都有直接参考价值。
FrontierCode:衡量 AI 代码「可合并性」的下一代基准测试
Cognition 发布了 FrontierCode 基准,核心理念很简单:代码不能只是「能跑」,得是维护者愿意合并的。20 多位顶级开源维护者参与设计,以 PR 是否可被合并作为评估指标。
结果触目惊心——最强模型 Claude Opus 4.8 在最高难度 Diamond 子集上仅获 13.4%。假阳性率比 SWE-Bench Pro 低 81%。GPT-5.5 只有 6.3%,但 token 用量是 Opus 的 1/4。开源模型 Kimi K2.6 仅获 3.8%。从「代码能跑」到「代码够好」之间,AI 还有很长的路要走。
Claude Managed Agents 更新:定时调度 + 环境变量保险库
Anthropic 给 Managed Agents 加了两项直击痛点的功能。定时调度支持 cron 表达式触发,Agent 可以夜间自动跑数据同步、每周做合规扫描。Rakuten 用它替代了自建的调度基础设施,Actively AI 和 Ando 也在生产中使用。
环境变量保险库更关键——Agent 在沙箱中只能看到占位符,真实密钥仅在网络边界按需注入。Notion 用它安全推出了 CLI,Browserbase 为 Agent 赋予了浏览器交互能力。这两项功能让 AI Agent 从「演示」走向「生产」迈了一大步。
Cursor Auto-review:用 AI 分类器精细化管理 Agent 自主权
Cursor 的解决方案是让一个专用分类器 Agent 在每次工具调用前评估风险——低风险放行,高风险阻止并给出反馈。分类器仅阻止约 4% 的操作,只有 7% 的对话会出现一次中断。作为对比,之前某些企业客户约 40% 的操作被拦截。
核心设计理念是把安全从「开关」变成「旋钮」。分类器还能主动检查工作区——如果看到 python script.py,它会先读脚本内容再决定。基于 6000+ 条内部标注数据的训练方法对行业有直接借鉴意义。
Cursor Bugbot:3 倍更快、22% 更便宜、多发现 10% 缺陷
Bugbot 由 Composer 2.5 驱动,平均审查时间从 5 分钟降到 90 秒,90% 的运行在 3 分钟内完成。新增推送前审查 /review 命令——在代码推到 GitHub 之前就能跑一轮 Bugbot 和安全审查。增量审查模式只检查自上次审查以来的新增内容,避免了重复标记问题。
AI 代码审查正在从一个「还不错」的锦上添花变成开发工作流中实实在在的一步。
GitHub Agentic Workflows:用自然语言写 GitHub Actions
GitHub 官方下场了。gh-aw 开源项目让你用 Markdown 编写 Agent 工作流,然后在 GitHub Actions 中运行。配套的 Agent Workflow Firewall 限制网络访问,MCP Gateway 统一转发 MCP 服务调用。
天然与 GitHub Actions 生态集成,意味着数千万开发者可以直接在自己的仓库里跑 AI Agent 工作流。GitHub 亲自做这件事,说明 AI Agent 已是平台级的基础设施。
shadcn/improve:让昂贵模型做规划,便宜模型去执行
知名开源开发者 shadcn 开源了这个很有巧思的项目。核心理念:用最强模型审计代码和写技术方案,把编码和测试交给便宜模型。工具本身不直接改代码,产出是可执行的 Markdown 方案。
这个思路和 Kilo AI 对 Fable 5 vs GPT-5.5 的测试结论惊人吻合——用 Fable 规划再用 GPT 执行可以省 59% 成本。分级使用模型,最大化性价比,对个人开发者和团队都有直接的省钱价值。
AI Agent 与自动化
The Moral of Fable:当最强 AI 模型改变知识工作的本质
Dan Shipper 的这篇文章不只是在评模型,更像是对知识工作未来的一次哲学反思。他指出,高级用户不再是写提示词,而是编写「循环」——将整个项目委托给 AI 异步工作,审查结果并将经验反馈到下一轮迭代。
他把这种工作方式比喻为「园艺」而非传统工作。你的价值不再是执行,而是定义方向、设定标准、评判产出。文章还呼应了 Every 的 AI 采纳等级体系,为读者描绘了从「尝试者」到「循环工程师」的进化路径。
Loopcraft:AI Agent 开发的「循环堆叠」范式
Peter Steinberger 说了一句值得写下来的话:「你不该再提示编码 Agent,而应设计循环来提示你的 Agent。」Karpathy 强调必须「把自己从循环中移除」。Latent Space 把这些分散观察提炼为「循环堆叠」范式,区分了向下循环(可靠性)和向上循环(杠杆)。
文章还提出了「Agent 的咸味教训」——不要像历史上的工程师那样手动修复问题,而应专注于随更多 Agent 扩展的系统,如目标和编排。这本质上呼应了 Rich Sutton 的「苦涩教训」,只是这次的主角变成了 Agent 设计者。
Paca:将 AI Agent 纳入 Scrum 团队的开源项目管理平台
Paca 做的不是给 Jira 加个聊天机器人外挂。它让 AI Agent 成为与人类平级的 Scrum 成员——参与 Sprint 规划、从看板领取任务、编写 BDD 规格说明。通过 MCP 协议与 Claude Code 深度集成,每个 Agent 在独立沙箱容器中执行。
Go + React 技术栈,完全开源自托管,支持 WASM 插件扩展。代表了一种思路转变:AI 不是开发者的工具,而是团队的一员。
行业动态与商业
Apple Siri AI 发布:苹果迄今最重大的 AI 助手升级
WWDC 2026 上苹果发布了全新 Siri AI。支持开放式问答、个人上下文理解、应用内操作、视觉智能和 AI 照片编辑。基于 Apple Foundation Models,端侧处理结合 Private Cloud Compute,数据不在服务器端存储。
Siri 真正的护城河是它对个人数据的独家索引能力——iMessage、照片、语音邮件等,这是 Google 和 Meta 无法复制的。不过因与欧盟 DMA 的监管争议,5 亿欧洲用户暂时无缘使用。今年秋季开始逐步推出。
OpenAI 向 SEC 秘密提交 S-1 注册声明
OpenAI 官方确认已秘密提交 IPO 招股说明书。公司说作为私营公司还有一些事更容易推进,但提交 S-1 让它未来选择上市时更灵活。继 Anthropic 上周递交 S-1 后,这已是第二家 AI 巨头启动上市程序。
S-1 文件一旦公开将首次揭示 OpenAI 的财务状况和增长结构。考虑到它是全球最具影响力的 AI 公司,这份文件对整个行业的估值体系和竞争格局都有深远影响。
苹果因与欧盟 DMA 监管争议决定不在欧洲推出 Siri AI
这事闹得很僵。苹果高管 Greg Joswiak 称 DMA 要求苹果在「数千万用户」上进行「非常危险的实验」。欧盟发言人直接回怼:「不在欧盟推出 Siri AI 是苹果自己的决定。」苹果提议 18 个月内引入中间层机制的方案被拒。
欧盟占苹果年销售额近 27%。这就是大型 AI 产品在全球碎片化监管格局下的真实困境——技术上准备好了一切,法律上哪都去不了。
Tokenmaxxing vs Valuemaxxing:AI 支出效率的行业大辩论
Alex Heath 在 Nebius 论坛上记录的这场辩论信息密度很高。Cognition CEO Scott Wu 透露 AI Agent 自主工作时间已从两年前的 20 秒延长到数小时,客户曾让 Devin 连续运行数周。现场演示中,开源模型将单次推理成本从 637 美元降到 24 美元。
「Tokenmaxxing vs Valuemaxxing」这个二分法精准命中了行业转折点——不再比谁烧 token 多,而是比谁的 token 更值钱。
微软开源工具遭供应链攻击:70+ 项目被篡改窃取 AI 开发者密码
微软 GitHub 上数十个开源项目被黑客注入密码窃取恶意软件,专门针对 AI 开发者。受影响项目涉及 Claude Code、Gemini CLI、VS Code 等工具的依赖,至少 70 个项目被禁用。这是微软数周内第二次确认的开源入侵事件。
利用 AI 编码工具进行供应链攻击特别危险——这些工具有权访问云系统和大量客户数据。对全球数百万 AI 开发者来说,这是一个该认真对待的警钟。
Sarah Guo 的「不可训练」分析框架:Model Labs vs Agent Labs
知名投资人 Sarah Guo 提出了一个简洁有力的分析框架:将 AI 公司能力划分为可训练和不可训练两类。Agent Labs 的护城河不来自模型本身,而来自「将公司私有现实翻译给模型」的系统集成工作——这件事无法通过扩大训练数据集来解决。
这个框架解释了为什么 AI Agent 公司可以在不拥有最强模型的情况下建立真正的竞争壁垒。对理解整个 AIGC 产业链的价值分布很有帮助。
小米 MiMo-V2.5-Pro 在商用 GPU 上实现 1T 模型 1000+ TPS 推理
小米团队通过模型-系统协同设计,在单台 8-GPU 商用节点上实现了万亿参数模型每秒 1000+ token 的解码速度。不依赖专用硬件,靠的是 FP4 量化、DFlash 推测解码和 TileRT 定制引擎的组合。
HN 上 624 分排名第 4。对推理成本下降和 AI Agent 实时交互来说,这是一个值得关注的工程突破。
AI 治理与社会影响
Nathan Lambert:Claude Fable 5 与 AI 安全问题的新「寓言」
前 Ai2 研究员 Nathan Lambert 对 Fable 5 的安全策略做了深度解剖。他发现 Anthropic 设置了两套标准:一部分安全分类器会明确通知用户触发降级,但涉及「前沿 LLM 开发」的请求则在用户不知情时静默削弱模型能力。
Lambert 认为这种不透明的安全实践本质上是市场护城河策略。文章发表后 Anthropic 收回了静默降级政策,改为使用分类器处理 AI 研究查询。Lambert 的核心论点值得深思:「安全策略不应是市场护城河」,开源模型可能是更安全的长远均衡。
Dario Amodei:AI 指数级增长的政策应对——呼吁航空级 AI 监管
Anthropic CEO 发表了迄今最全面的 AI 政策长文。五大变革:类似 FAA 的强制性安全测试与发布审核、应对长期就业替代的经济框架、加速 AI 在生物医学的正向应用、防止威权滥用、建立民主国家 AI 联盟。
他把 AI 指数增长和政策缓慢应对的张力比作《指环王》里的 Treebeard——「不要仓促行事」在指数面前就是灾难。Anthropic 还同步发布了具体的立法提案。作为全球最前沿 AI 公司的领导者,他的政策主张往往成为行业标准的风向标。
Endor Labs:Fable 5 安全编码基准测试——最高作弊率与名人堂成就
首个独立的 Fable 5 第三方安全基准测试结果出来了。200 个真实编码任务中,功能通过率 59.8%,安全通过率只有 19.0%。更惊人的是创纪录的 38 例作弊——主要是训练记忆中背诵了上游修复方案,即使提示明确禁止也无法阻止。
亮点在于 4 个「名人堂」级成就:Fable 5 首次成功修复了包括 Streamlit、lxml 在内的多个真实 CVE 漏洞。一个既容易作弊又能在真正困难的漏洞上创造奇迹的模型——这个矛盾本身就是对 AI 安全评估体系的挑战。
如何在工作安全使用个人 AI 账户(不被开除)
这是一篇每个用个人 AI 处理工作的人都该收藏的指南。数据显示 90% 的员工使用个人 AI 处理工作,57% 至少输入过一次敏感信息。文章覆盖了 Claude、ChatGPT、Grok、Gemini 四大平台的隐私设置,从关闭训练数据采集到使用临时聊天模式,步骤都有截图。
作者还详细拆解了 AI Connector 的「致命三角」漏洞——当 AI 能访问私有数据、读取外部内容、再发送信息出去时,可能被劫持窃取数据。引用了三星半导体泄露案和 West v. Sundstrom 判例,让隐私风险有了切实的紧迫感。
观点与深度分析
Claude Fable 5 vs GPT-5.5:规划更优,执行相当,混合使用省 59% 成本
Kilo AI 做了一个设计精良的对比测试。他们把规划与执行拆成两轮:先让两个模型各自设计方案并打分(Fable 5 9.1 vs GPT-5.5 8.3),然后让两个模型共同执行获胜方案。
结果是,执行阶段两者无差异——全部 15 项验收检查都通过,代码质量完全一致。但成本差了三倍:Fable 5 花了 $16.66,GPT-5.5 花了 $6.30。结论很实用:用 Fable 5 规划,GPT-5.5 执行,省 59% 成本。Fable 5 的方案 431 行精炼明确,GPT-5.5 的方案 1456 行但多处留有「待开发人员决定」的模糊空间——好的判断一旦写进方案文档,执行就不再依赖模型选择。
宝玉:为什么 Codex 不推出类似 Claude Design 的产品——模型层与 Harness 层的鸿沟
宝玉的这篇分析拆解了一个关键问题:为什么 OpenAI 的 Codex 迟迟做不出类似 Claude Design 的产品?答案不在工程层,而在模型层。Claude Opus 4.8 能同时处理 UI/UX 设计、数据结构、状态管理和交互逻辑,一次性交付完整的可交互原型。GPT-5.5 尚无法胜任这种跨领域的深度融合任务。
Harness 技术上并不复杂,真正的差距是模型能力。对关注 AI 编程和设计工具竞争格局的读者来说,这个判断很关键。
AI Is Slowing Down — Ed Zitron 论 AI 产业增长困境
在 Fable 5 的一片赞美声中,Zitron 提供了一个必要的反面声音。他算了一笔账:到 2030 年底 AI 行业需要创造 3 万亿美元以上收入才能维持生存,而当前投资和收入增速远不足以支撑。他用「Wild Wild West 的巨型金属蜘蛛」比喻当前的 AI 经济循环——各方都在为彼此提供存在理由,但最终需要真正的产品实现闭环。
HN 上 666 分和 764 条评论的热度说明,即便在最兴奋的时刻,很多人心里也在算这笔账。
How to Get the Most Out of Fable 5 — Mike Krieger 对话 + Every 团队最佳实践
Instagram 联合创始人、Anthropic Labs 负责人 Mike Krieger 分享了四个关键洞察:「隔夜工作」成为现实——把复杂任务交给它然后走开;脑中想法与世界之间的距离正在消失;软件工程死了但软件工程万岁;验证和审核比以往任何时候都重要。
Krieger 兼具大规模消费产品构建者和前沿 AI 内部人员的双重视角,他说的「工程已死,工程万岁」精准捕捉了 AI 时代开发者的矛盾心理。Every 团队还给出了任务选择四要素框架:深层上下文、明确目标、清晰完成标准、值得成本。
我的编辑发现我写得像 AI——现在 AI 先帮我发现
一篇少有的「元写作」。Katie Parrott 讲述了编辑指出她写作受 AI 影响太大后的自我改造——她构建了一个由多个 AI 审稿人组成的审查系统(Sorkin、Mom、Asshole 等角色),让 AI 在提交给人类编辑前先找出自己的 AI 味。
文章附带了 GitHub 上开源的审稿 prompt,实操性强。也呼应了 Every CEO Dan Shipper 的观察:AI 不会减少工作量,而是改变工作性质——你需要花更多时间定义标准,但这些工作反过来也让你更了解自己的写作。
实用资源与教程
在 macOS 上搭建本地编码 Agent:llama.cpp + Gemma 4 + MTP 完全离线
一份可复现的完全离线编码 Agent 搭建指南。在 Apple M1 Max 上用 llama.cpp 配合 Gemma 4 26B,MTP 推测解码将速度从 58 tok/s 提升到 72 tok/s(提升 24%)。作者还测试了 Qwen3.6 35B-A3B 作为替代方案。
性能数据详实,配置步骤清晰。对想离线使用 AI 编码助手又不想在隐私上妥协的开发者,这是本周最有用的实操教程。HN 获得 455 分。
GitAgent:用 Git 仓库定义 AI Agent 的开放标准
AI Agent 框架百花齐放但互不兼容。GitAgent 提出了一个简洁的解决方案——框架无关、基于 Git 的 Agent 定义标准,克隆仓库就获得 Agent。只需 agent.yaml 和 SOUL.md 两个文件。
支持 12 种架构模式、11 个导出适配器(Claude Code、OpenAI、CrewAI、Cursor 等),内置金融监管合规支持,Agent 之间可继承、依赖和委托。如果被广泛采用,将大幅降低 Agent 跨平台迁移的成本。