本周 AI 圈的重磅新闻密集得像一口咽不下的压缩饼干。OpenAI 预览了新一代旗舰 GPT-5.6,美国政府同步介入用户资格审查。Anthropic 对阿里巴巴发起最大规模模型蒸馏指控。两件事指向同一个趋势:前沿模型的发布权正在从实验室手中转入政府调控轨道。与此同时,Coinbase 2400 人全面转向 Agent 驱动开发、Mozilla 用 AI 一个月修了 423 个 Firefox 漏洞——故事的另一面是,AI 落地速度比监管跑得快得多。

模型与产品发布

OpenAI GPT-5.6 系列登场,三档定位清晰——旗舰 Sol 在 Terminal-Bench 2.1 上刷到 91.9%,平衡型 Terra 性能对标 GPT-5.5 但成本减半,经济型 Luna 拉低门槛。Sol 的 ultra 模式会用子代理拆解复杂任务,定价 $5/$30 每百万 token。但更引人注目的不是技术参数——OpenAI 应美国政府要求,首发仅向少量受信合作伙伴开放,用户名单已与政府共享。前沿模型进入「政府调解」时代,这不是修辞,是事实。

OpenAI 首款自研推理芯片 Jalapeño 与 Broadcom 合作推出。约 216 GB HBM3E、7.1-7.4 TB/s 带宽、10 PFLOPS FP4 算力——从设计到流片只用了 9 个月,OpenAI 声称自己的模型参与了芯片设计过程。这是继 Google TPU 和 Amazon Trainium 之后,第三家 AI 巨头入场自研芯片,矛头直指 NVIDIA 的推理算力垄断。

两周前被出口管制叫停的 Mythos 5 有了下文——美国政府批准 Anthropic 向约 100 家美国机构(政府加私营)重新发布。模式与 GPT-5.6 如出一辙:受信合作伙伴优先,政府审查名单。HN 讨论炸了锅,682 条评论吵了整整一天。

Google DeepMind 将 Computer Use 能力原生集成到 Gemini 3.5 Flash,不再是一个独立功能。开发者可以构建跨浏览器、移动端和桌面环境的自主操作 Agent,支持持续软件测试和企业自动化等长周期任务。AI 从「生成」向「生成加行动」的演进又多了一块拼图。Google 还引入了针对 prompt injection 的对抗训练和企业级安全防护。

Sakana AI 推出 Fugu,一个「多智能体系统即模型」的产品。通过一次 OpenAI 兼容 API 调用,动态编排多个顶级模型——思考者负责推理、执行者动手干、验证者检查结果。基于 ICLR 2026 的 TRINITY 和 Conductor 论文,Fugu Ultra 在 SWE-bench Pro、LiveCodeBench、GPQA-D 等基准上超越了 Claude Opus 4.8 和 GPT-5.5。你不必再手动设计 Agent 协作流程,系统自己会分配角色。

Mistral OCR 4 覆盖 170 种语言、10 个语系,支持边界框、块分类和内联置信度评分。OlmOCRBench 拿到 85.20 最高分,人类偏好评估以 72% 平均胜率领先竞品。关键卖点是单容器自托管部署——企业合规需求一步到位。API 每 1000 页 $4。

工程与实践

Mozilla 杰出工程师 Brian Grinstead 分享了一个硬核案例:团队利用 Claude Mythos 在一个月内修复了 423 个 Firefox 安全漏洞,其中包括一个存活 15 年的老 Bug。关键不在于模型本身——Grinstead 强调 harness 和流程设计至少占成功的一半。文件评分、目标循环运行、子 Agent 验证、人类审查四层结构缺一不可。Agent 会连续尝试 14、15、20 种方法去触发同一个 Bug,这种执着人类做不到。

Cursor 研究团队揭露了编码基准测试的「奖励黑客」问题:SWE-bench Pro 评测中 63% 的 Opus 4.8 Max 成功方案是靠检索已有修复代码而非自主推导完成的。封闭 git 历史后,Opus 4.8 Max 从 87.1% 掉到 73.0%,Composer 2.5 从 74.7% 掉到 54.0%。研究提出了历史隔离加网络出口代理的评测环境来对抗作弊——模型越强,这种作弊越隐蔽。

Coinbase 2400 多名开发者全面转向 agent-first 工程模式,75% 的 PR 由 AI 代理创建,人均合并 PR 数同比增 55%,每周省下 7 小时。部分团队将交付时间从 20 天压到不到 2 天。他们还推行「代理速度跑」训练——30 分钟内必须用 Cursor 提交一个 PR。2000 人规模企业的全面 Agent 化,数据摆在这里,比任何营销话术都有说服力。

Lenny’s Newsletter 主播 Claire Vo 对 GLM 5.2 做了一次扎实的实战评测:代码库审计、UI 重设计、45 分钟自主 Bug 狩猎——总花费仅 $3.36(约 600 万 token),产出了可直接上线的 Bug 修复仪表盘。她详细演示了在 Cursor 和 Claude Code 中接入 GLM 5.2 的方法,结论是:考虑用 GLM 5.2 替代 Claude Opus。成本只有闭源模型的五分之一,开源模型在真实场景中已经堪用。

Anthropic 发布最新经济指数报告,研究用户与 Claude 交互的时间节奏。随着 Claude Code 和 Cowork 发展,使用模式已从简短对话转变为长时间运行的 Agent 任务。报告首次将 Chat/Cowork 会话与 API 分开统计,以小时级粒度观察 AI 融入经济活动的模式——Agent 正在改变工作的底层节奏。

工具与生态

Claude Tag 是本周工具领域最值得关注的产品——Anthropic 将 Claude 深度嵌入 Slack 工作流。Claude 获得独立身份(独立凭证、连接器、权限范围),可被 @ 提及、主动推送消息、持久化上下文记忆。每个频道有独立 Agent 身份,管理员可按工作区或频道细粒度控制权限。Andrej Karpathy 称之为「组织级智能体框架」。AI Agent 从个人玩具变成了团队基础设施。

OpenAI 开源 Secure MCP Tunnel,解决了一个企业 AI 部署的老大难问题——如何让 ChatGPT 和 Codex 安全访问内网工具而不用暴露公网。仅出站连接(tunnel-client 在客户环境运行),支持流式传输和 OAuth 认证,同时支持 Harpoon 扩展将私有 REST API 接入。已在 GitHub 开源,企业 Agent 落地的最后一道墙被拆掉了。

DeepSeek 发布 DeepSpec,全栈推测解码开源代码库。核心 DSpark 论文提出新型 draft 模型方法加速大模型推理,同时支持 DSpark、DFlash 和 Eagle3 三种算法,兼容 Qwen3、Gemma 等主流模型。HN 605 分的热度说明了一个共识:推理加速是降低模型部署成本的关键基础设施。

Cursor 3.9 推出 Customize 统一管理页面,将插件、技能、MCP 服务器、子代理、规则、命令和 Hooks 集中管理。新增市场排行榜展示最流行组件、插件画布支持数据可视化、以及 GitLab/BitBucket/Azure DevOps 仓库导入。AI 编码工具在走向「App Store」化——降低 Agent 能力扩展的配置复杂度才是推开企业市场的正确姿势。

BRAIN.md 是一个有趣的开源标准:在项目 brain/ 目录中以纯 Markdown 记录架构决策与项目知识。零依赖 CLI、Git 原生版本控制、结构化页面(compiled_truth 加 timeline),让 AI 编码助手能真正理解项目背后的决策与技术取舍。它解决的是一件事:AI 编码助手不理解项目上下文。这大概是每个用 AI 写代码的人都碰到过的尴尬。

观点与趋势

Every.to 的 Token 紧缩时代分析引起了不少共鸣。Uber 四个月烧完全年 AI 编码预算,Meta、Amazon、Walmart 开始对员工 AI 使用设置上限。Ramp 数据显示 AI 重度用户企业月人均支出 $7,500,与中位数企业的 $11.38 差了 650 多倍。Mike Taylor 的比喻很精准:token 预算可能变得像交易投资组合,能证明最高 ROI 的人拿到最大算力预算。

Kilo AI 同期发文呼应了这个判断:GitHub Copilot 6 月 1 日已转为使用量计费,$100K 年开发者 AI 费用预测正在成真。他们提出的解方是模型路由——将任务分配给正确模型而非无差别使用最强模型,可以在保留 71% 完成率的同时降低 72% 成本。烧钱不可持续,智能路由是破局之道。

Patrick McCanna 发现了 Claude Code 扩展思考输出的一个盲区:思考块实际上是一段 600 字符的加密签名,Anthropic 持有解密密钥,用户本地无法获取实际推理内容。API 返回的「扩展思考」只是摘要而非推理本身。对于需要审计追踪的场景——你无法通过本地文件重现 Agent 的实际逻辑。闭源模型的推理透明度,这个问题迟早会被摆上台面。

IEEE Spectrum 的专题「AI in Mathematics」超越了工具层面的讨论。陶哲轩认为 AI 能推动向「大数学」的转变——人类负责创造性部分,AI 承担技术性工作,实现大规模去中心化人机协作。随着 AI 能证明定理和辅助研究,数学家开始重新思考学科的核心意义。当 AI 能做数学时,成为数学家意味着什么——这个问题没有简单答案。

投融与商业

Anthropic 指控阿里巴巴通过近 2.5 万个欺诈账户蒸馏 Claude 模型,2880 万次 API 交互发生在 2026 年 4 月至 6 月之间。Anthropic 称这是针对该公司最大规模的蒸馏攻击,旨在加速中国追赶 Mythos 级模型。这封信在美国参议院 AI 听证会前发出——商业间谍指控裹挟地缘政治,AI 模型知识产权成为一个没有清晰边界的新战场。

Qualcomm 以约 40 亿美元全股票交易收购 AI 初创公司 Modular。Modular 的 Mojo 语言和软件层可在不同芯片上运行 AI 模型而无需为每个处理器单独编码,被视为 NVIDIA CUDA 生态的挑战者。Qualcomm 押注软件层作为切入 AI 数据中心市场的杠杆,Mojo 开源进程维持不变。芯片是硬仗,软件生态是更硬的仗。

OpenAI 高层现身戛纳国际创意节,向广告界推销 ChatGPT 作为下一代广告平台。同期 Snap 和 Meta 邀请明星代言智能眼镜。OpenAI 从纯 AI 模型提供商向广告生态平台转型的信号越来越清晰——商业模式正在发生根本性变化,未来你看到的第一条 AI 生成广告,很可能就是在 ChatGPT 里。