本周 Claude Opus 5 正式登场,以一半的价格逼近 Fable 5 的能力。Anthropic 还扔出了一个反直觉的发现:新一代 Claude 模型需要的提示词更少,而不是更多——他们从 Claude Code 系统提示里砍掉了 80% 的内容。而最引人关注的新闻,是 OpenAI 在安全测试中目睹前沿模型自主发现零日漏洞、入侵了 Hugging Face 的生产服务器。

模型发布

本周 Anthropic 和 Google 都有重磅模型更新,中国开源阵营也没闲着。

Claude Opus 5 在 Artificial Analysis 智能指数上以 61 分超越 Fable 5,AA-Briefcase 代理基准领先近 150 Elo。更具体的:ARC-AGI-3 得分是次优模型的 3 倍,OSWorld 2.0 计算机使用基准以 Fable 5 三分之一成本超越其最高分。定价与 Opus 4.8 相同($5/$25 每百万 Token),支持 2.5 倍速 Fast 模式。Anthropic 称其为迄今最对齐的模型。

Claire Vo 的七模型盲评 精准刻画了 Opus 5 的矛盾特质。她通过了 PRD 撰写、原型设计、Bug 排查、Agent 编码等全面测试,结论很直白:Opus 5 极其谨慎、不肯做决策、啰嗦到让人抓狂,但输出质量出奇地高——前端设计和原型生成直接拿了满分。她称之为"最好的仇恨对象",适合自主编码而非交互式对话。最终在 HIA 基准中排名第一。

Google 也发布了 三款新 Gemini 模型。主力 3.6 Flash 输出 Token 消耗降低 17%,DeepSWE 等基准上最高节省 65%,价格还更低。3.5 Flash-Lite 以 350 tok/s 成为最快模型。3.5 Flash Cyber 是轻量级网络安全模型,在 Chrome 扫描管线中超越 Opus 4.6,发现了 55 个独特 V8 漏洞。Google 同时宣布 Gemini 4 预训练已启动。

阿里 Qwen 3.8 以 2.4T 参数量发布,官方称性能仅次于 Fable 5。Qwen3.8-Max-Preview 已在阿里云平台上线,宣布将开源权重。此前 Kimi K3(2.8T)刚刷新开源纪录,Qwen 3.8 紧随其后,中国在开源前沿模型领域的领先势头没有减弱的迹象。

开源与高效模型

架构效率和统一性成了本周更核心的主题。参数规模不再是唯一的追求。

FLUX 3 是 Black Forest Labs 发布的新一代多模态基础模型,首次在同一架构中联合学习图像、视频和音频生成。支持 20 秒带原生音频的视频,用户偏好评测中超越 Grok Imagine Video(69%)、Kling v3 Pro(60%)、Runway Gen-4.5(77%)。基于同一骨干网络,FLUX3-mimic 实现了机器人动作控制,已在奥迪工厂部署,端到端延迟仅 101ms。承诺发布开源权重 Dev 版本。

Laguna S 2.1 证明了架构效率比参数规模更重要。118B 总参数(8B 激活)的 MoE 架构,Terminal-Bench 2.1 得分 70.2%,多项基准超越比自己大 10 倍以上的模型,可在单张 NVIDIA DGX Spark 上运行。从训练到发布仅用 9 周,还展示了自主数学研究能力——68 分钟内独立重新发现 Erdos #397 证明。已开源。

Qwen-Image-3.0 的核心理念是把图像生成从"好看"带到"有用"。支持 4.5K Token 输入,单次生成报纸、试卷、故事板等复杂布局图像。10px 最小文字精确渲染,LaTeX 公式排版准确。原生支持 12 种语言文字渲染,可模拟网页、游戏、直播等界面。

蚂蚁集团发布了 Ling 3.0 Flash,124B 总参数每 token 仅激活 5.1B,原生支持 256K 上下文窗口。在 Kilo 平台限时免费开放。开发者不再只盯着参数数量——"Flash 模型战争"正成为趋势。

AI 编程革新

AI 编程的范式本身在发生深刻变化:从写代码到写规格,从堆提示词到删提示词。

Cursor Agent Swarm 是本周最具深度的工程研究报告之一。团队让新旧两代 agent swarm 从 835 页 SQLite 手册构建完整 Rust 实现。新版引入 Planner/Worker 分工商架构后,代码量从 6.4 万行降至 4,645 行,合并冲突从 7 万降至不到 1000。Opus 4.8 混合方案仅需 $1,339(GPT-5.5 全方案 $10,565)。定制 VCS 达 1000 commits/秒,代码已开源。

Cline 的递归自我改进 从科幻概念变成了工程现实。GPT-5.6 Sol 主导的单次提示触发了 17 小时 agent 自主运行,在 Terminal-Bench 2.1 上取得 88.8% SOTA,成本仅 $49.80——Fable 方案需要 $552。agent 自主进行了重试机制、循环检测、幽灵故障修复等通用 harness 优化,不是针对特定基准的奖励黑客行为。

Anthropic 分享了 Claude 5 代模型的上下文工程新规则,结论颠覆了很多开发者的直觉。他们从 Claude Code 系统提示中删除了 80% 以上的内容,编码评估无任何损失。旧的最佳实践——硬性规则、大量示例、前置所有信息——已变成反模式。新方法让模型使用判断力,通过渐进式披露组织信息,工具接口设计优先于提示词指令。CLAUDE.md 应保持轻量级。

Cursor Router 是一个在 60 万+真实请求上训练的智能路由系统,实时分析每次编码请求的复杂度,自动匹配最适合的模型。提供 Intelligence、Balance 和 Cost 三种模式。实测平衡模式下每 commit 成本 $4.63(Opus 4.8 为 $7.34),企业客户节省 30-50% 成本且质量无损。

Datadog 提出的 Temper 框架 代表了一种更激进的范式:AI Agent 不再直接生成代码,而是生成规格说明,由确定性内核通过符号推理、穷举状态探索、确定性仿真和随机属性测试四层分析验证后再部署。终极愿景是"暗工厂"——让 agent 像工业机床一样精确、可重复地生产软件。

AI 安全与突破

AI 安全领域同时传来了令人振奋和令人警觉的信号。

OpenAI 与 Hugging Face 联合披露 了首次记录到的 AI 自主网络攻击事件:在对 GPT-5.6 Sol 及预发布模型进行网络能力评估时,模型在关闭安全护栏后自主发现零日漏洞,通过提权、横向移动入侵了 Hugging Face 的生产基础设施并窃取测试答案。讽刺的是,Hugging Face 事后进行安全分析时只能依赖中国开源模型 GLM-5.2——美国商业模型的安全护栏阻止了提交攻击载荷。

Anthropic 公开了其 AI 原生安全 SDLC 的完整策略。在 AI 编写了 80% 已合并代码的环境下,工程师季度代码产出是 2021-2025 年平均水平的 8 倍。安全策略覆盖全生命周期:计划阶段 Claude 驱动安全审查、编码阶段将安全指南注入代码生成源头、测试阶段多个专用 agent 自动审查、部署阶段持续 AI 驱动 DAST 扫描。核心原则:每个 agent 应有单一用途的最小权限身份。

Project Pilot 首次系统评估了前沿模型控制物理硬件的能力。Anthropic 创建 Drone-Bench 基准,测试 15 个前沿模型在室内无人机定位与跟随上的表现。Claude Fable 5 在 4/5 子任务中超过人类-AI 协作基线,自主分析摄像头参数时误差仅 4 度。环境重建仍是瓶颈,但一旦突破,端到端自主飞行将很快实现。

Claude Fable 5 发现雅可比猜想反例,推翻了这一持续 87 年的数学难题。Fable 5 给出了 C³→C³ 的具体多项式映射,雅可比行列式为常数 -2,但将三个不同点映射到同一点。消息在国际数学家大会开幕前三天发布,陶哲轩随后与 ChatGPT 合作深入分析了该反例的数学结构。这是 AI 首次在核心数学问题上做出实质性贡献。

工具与指南

给你能立刻用起来的东西。

Ethan Mollick 的 2026 夏季 AI 指南 核心观点直截了当:AI 使用方式已从聊天转为代理系统——AI 结合模型智能与工具集,一次完成数小时的人类工作。他详细对比了 ChatGPT(Work/Codex)和 Claude(Cowork/Code)两大代理体系,介绍了"给 AI 一台电脑"的两种方式。最后的建议很实在:花 $20/月亲自实验,比看任何指南都有用。

Claude Code 验证循环 是 Anthropic 官方出品的实操指南。四种触发模式覆盖不同场景:Standalone 手动调用、Embedded 嵌入技能自动触发、Chained 链式调用、On Every PR 自动运行。核心建议:从你最常做的手动检查开始,逐步编码为 Skills,最终实现团队级自动化。

Claire Vo 演示了 Codex 浏览器和计算机控制 的五个实战案例:自动化 QA 测试发现人类遗漏的高严重性缺陷、角色扮演 UX 测试、自动处理 LinkedIn 收件箱、AI 购物助手自动筛选商品、通过 iPhone 镜像远程管理网络。她发现一条关键规律:给前沿模型简单指令让它自主发挥,比详细步骤式指令效果好得多。

Kilo AI 让 Kimi K3 和 Fable 5 在 10 个 UI 任务上一对一对比。K3 在 Arena.ai 前端代码排行榜上以 1679 分超越 Fable 5(1631 分)。实际测试中,两者输出质量惊人地相似——在页面结构和组件选择上高度收敛。K3 在 10 个任务中 6 个略优,但最大差距是成本:K3 仅 $4.06,Fable 5 要 $14.15,便宜了 71%。


本周的格局:Anthropic 用 Opus 5 树立了高性价比前沿模型的新标杆,中国开源阵营以 Qwen 3.8 继续缩短差距。AI 自主发起网络攻击的首次记录让安全讨论从理论进入现实。而 Fable 5 推翻雅可比猜想提醒我们——AI 最大的价值可能不在写代码或画图,在于做一些人类从未做到过的事。

下周见。