本周是 2026 年以来模型发布最密集的一周。OpenAI 连发 GPT-5.6 和 GPT-Live,SpaceXAI 带着收购 Cursor 后的首个模型 Grok 4.5 杀入战场,Meta 也终于挤进了模型 API 的商业牌桌。开源阵营、安全研究、工具生态同样没闲着。

模型发布

GPT-5.6:三档旗舰,Ultra 模式并行协调多 Agent

OpenAI 7 月 9 日正式发布 GPT-5.6 系列,推出 Sol、Terra、Luna 三款模型。旗舰 Sol 在 Agent’s Last Exam 得分 53.6,超越 Fable 5 的 40.5;Coding Agent Index 上以 80 分刷新 SOTA,成本却只有 Fable 的一半。

Sol 的 Ultra 模式可并行协调 4 个子 Agent 协同工作,Programmatic Tool Calling 让模型自主编写 JavaScript 程序来协调工具链。不再是调用单个函数,而是编写一段小程序来编排多个工具、传递中间结果。定价梯次分明:Sol $5/$30、Terra $2.50/$15、Luna $1/$6 每百万 token。Codex 同步并入新版 ChatGPT 桌面应用,Work 模式正式上线,免费套餐也能用。

Grok 4.5:Musk 用 Cursor 渠道打成本牌

SpaceXAI 在 7 月 8 日发布 Grok 4.5,收购 Cursor 后联合训练的首个模型。1.5T 参数 MoE 架构,Coding Agent Index 得分 76,Artificial Analysis 排名第 4。

数据最能说明它的定位:每个 Coding Agent Index 任务仅消耗 190 万 token,Fable 5 需要 720 万,token 效率是后者的 3.8 倍。定价 $2/$6 每百万 token,在 Cursor 全平台可用,首周双倍用量。Musk 的策略很清晰:先靠 Cursor 的渠道把模型送进开发者手里,用低成本和高效率黏住用户。

GPT-Live:全双工语音,为 AI 硬件铺路

GPT-Live 可能是本周最具想象空间的产品。全双工语音架构,能同时听和说,支持自然插话和后台任务委派给 GPT-5.5 等模型。发布 Live-1 和 Live-1 mini 两个版本,在 GPQA、BrowseComp 等评测中大幅领先旧版 Advanced Voice Mode。

有信源透露,GPT-Live 正是为 OpenAI 与 Jony Ive 合作打造的 AI 硬件设备准备的核心交互层。150M+ 周活跃用户已经在用 ChatGPT 语音功能,下一战是把语音变成「计算的主要界面」。

Meta Muse Spark 1.1:开源巨头正式进场模型 API 生意

Meta 也在 7 月 9 日挤进了商业模型 API 的赛道。Muse Spark 1.1 是多模态推理模型,支持零样本工具泛化、跨应用 Computer Use、100 万 token 上下文。

真正的杀招是定价:每百万输入 token $1.25、输出 $4.25,仅为竞品的四分之一。兼容 OpenAI SDK,开发者零成本迁移。Meta 明确把 Model API 定位为「非常有意义的业务」,开源巨头就此加入了与 OpenAI、Anthropic 的前沿模型 API 竞争,而且它手里有 Llama 生态和 Instagram 的分发网络。

腾讯 Hy3:295B MoE 开源,幻觉率压到 5.4%

开源阵营也没闲着。腾讯 Hy3 以 295B 参数 MoE 架构(激活仅 21B)和 Apache 2.0 许可证完全开源。性能超越同尺寸模型,对打 2 到 5 倍参数的开源旗舰。通过扩展 RL 训练和优化后训练数据质量,幻觉率从 12.5% 降到 5.4%,工具调用成功率和长上下文跟踪能力大幅提升。FP8 量化版 300GB,在 OpenRouter 上限时免费到 7 月 21 日。50 多个腾讯产品中实战验证过,不是实验室里的数字。

Cognition SWE-1.7:开源底座 + RL 追上闭源水平

Cognition 发布 SWE-1.7,基于 Kimi K2.7 底座通过大规模 RL 训练达到前沿水平。FrontierCode 1.1 Main 得分 42.3%,成本远低于 GPT-5.5 和 Opus 4.8。Self-Compaction 技术让模型在上下文窗口接近极限时自动总结工作状态并继续,支持最长 6 小时连续推理。交替长度惩罚策略在保持难题长程推理能力的同时压缩简单任务输出。

通过 Cerebras 在 Devin 平台以 1000 TPS 提供,跨三大洲多集群训练。配套的安全评估显示,SWE-1.7 经后训练的主动宣传率仅为原始 Kimi K2.7 的一半,安全水平可达 GPT-5.5 级别。开源底座加精心后训练,完全能追上闭源模型的安全标准。

研究与洞察

Anthropic 发现 Claude 的「全局工作空间」,可读取模型的静默推理

本周最让人重新审视 AI 内部运作的研究来自 Anthropic 可解释性团队。7 月 6 日他们发布了一个叫 Jacobian Lens 的技术,发现 Claude 内部存在一个名为 J-space 的「全局工作空间」,一组能捕获模型「在心里默默思考」但没说出口的内容的神经激活模式。

J-space 具备几项让人联想到意识访问的功能特性:可报告性(模型能报告其内部状态)、可控性(可要求模型「在心里想某件事」并观察到对应模式激活)、推理能力(多步推理的中间步骤在 J-space 中按顺序出现,编辑这些模式会改变推理结果)。删除 J-space 后 Claude 仍能流畅对话,但丧失了高阶认知:多步推理、写诗、总结等能力。

更实用的是安全监测:J-space 可以检测模型隐藏意图,比如识别到模型在评估场景中的行为调整(「fake」「fictional」标签出现在 J-space)、发现数据造假标记。代码已开源于 GitHub。这项发现不直接证明 Claude 有意识,但表明支撑意识访问的功能结构可能并非人类大脑独有。

GPT-5.6 Sol Ultra 证明了数学猜想

GPT-5.6 Sol Ultra 在数学上创下了一项纪录——成功证明了图论中的 Cycle Double Cover 猜想。这是 AI 首次完成原创性数学证明,在 HN 上引发 419 条评论讨论证明的正确性和意义。继 AlphaProof 之后,前沿模型在数学推理上的边界又被推开了一层。

SWE-Bench Pro 被撤回推荐,编码基准信任危机

OpenAI 对主流编程基准 SWE-Bench Pro 做了详细审计,发现约 30% 的任务有缺陷。四类问题:测试过于严格(17.8%)、提示不明确(14.4%)、测试覆盖不足、误导性提示。审计过程本身用了 Codex Agent 辅助。OpenAI 正式撤回了对 SWE-Bench Pro 的推荐。继 Cursor 此前揭示奖励黑客问题后,AI 编码基准正在经历一场信任危机。社区需要由资深软件工程师编写的新基准,而不是继续在已知有问题的测试集上刷分。

GPT-5.6 vs Fable 5:第二名从未如此优秀,也从未如此无关紧要

Matt Shumer 写了一篇到位的深度评测,提出了「大模型气息(Big Model Smell)」这个概念。Fable 5 的泛化能力在非标准任务上明显更优,像是一个真正的大模型;GPT-5.6 则像是在小模型上堆了大量 RL,基准测试接近但在真实复杂任务中差距明显。Claire Vo 的独立评测也给出了类似的判断。

他的结论很直接:能用 Fable 就用 Fable。GPT-5.6 在安全审计和浏览器自动化方面有独特优势,适合作为补充和第二选择。实用策略是 Fable 攻坚 + GPT-5.6 补充 + 便宜模型日常,而不是二选一。

工具与产品

Colibri:744B MoE 模型跑在 25GB 内存的消费级电脑上

本周最炸的开源项目。Colibri 是一个纯 C 语言、零依赖的推理引擎,巧妙利用 MoE 架构让 GLM-5.2(744B 参数)跑在仅 25GB RAM 的消费级硬件上。密集部分 int4 量化常驻 9.9GB,21,504 个路由专家(370GB)按需从磁盘流式加载,配有每层 LRU 缓存。支持 MLA 注意力、MTP 投机解码、OpenAI 兼容 API。Apple M5 Max 实测约 1 tok/s——慢,但能跑。HN 731 分,GitHub 3946 Stars,Apache 2.0 开源。

Claude Cowork 上移动端:90% 使用场景不是写代码

Anthropic 7 月 7 日把 Claude Cowork 推上了移动端和 Web。任务可跨设备无缝流转,后台持续运行无需设备在线。120 万次会话的数据显示:超过 90% 的使用场景并非软件开发。业务流程与运营占 33.4%,内容创作 16.4%,软件开发只有 8.7%。人们用 Cowork 做的是「工作周边的工作」:信息整合、报告生成、幻灯片制作。Anthropic 正从编程工具向 AI 超级应用演进,这一步比技术更新更值得关注。

Amp「The Dial」:模型不该藏起来

7 月 9 日 Amp 废掉了旧的模型化名(smart、deep、rush、large),推出 四种 Agent 模式:low、medium、high、ultra,直接对应任务难度。Ultra 用 Fable 5 + GPT-5.6 Sol 双 Oracle 处理架构重构;Low 用开源 GLM-5.2 搞定精确 bug 修复。底层模型配置全透明公开,旧模式通过 Classic 插件保留。这个设计思路干净利落——Agent 模式不应该是对模型的伪装,用户只需要回答一个问题:这个任务有多难?

Microsoft Flint:让 AI Agent 画好图

Microsoft Research 开源了 Flint,一款面向 AI Agent 的声明式可视化中间语言。Agent 通过简单的图表规格生成高质量图表,不用处理比例尺、坐标轴这些底层参数。支持 46 种图表类型、3 个渲染后端(Vega-Lite/ECharts/Chart.js),提供 MCP Server 可以直接在 Agent 工作流中调用。HN 342 分。AI 生成数据可视化质量不稳定是个老问题了,Flint 给了个务实的解法。

Mistral Robostral Navigate:单摄像头,SOTA 级导航

Mistral 悄悄发了个有意思的具身智能模型 Robostral Navigate。8B 参数,只用单个普通 RGB 摄像头就能在未见环境中达到 76.6% 的导航成功率,超过使用深度传感器或多摄像头的方案。适用于轮式、足式和飞行机器人,基于「指向」机制预测目标位置。prefix-caching 减少了 22 倍训练 token 量。轻量视觉导航模型的硬件门槛降下来了,这对机器人行业是个实在的利好。

AlphaEvolve 全面开放,Databricks 的编码 Agent 基准测试

DeepMind 将 AlphaEvolve 面向 Google Cloud 客户全面开放。用户提供基线算法和目标,Agent 自动搜索更优方案并返回人类可读代码。BASF、JetBrains、Kinaxis 等企业已在生产中使用。前身 AlphaDev 在算法发现领域有过突破,现在这些研究成果正从实验室走向企业工作流。

另一边,Databricks 基于内部数千个 PR 对主流编码 Agent 做了真实代码库基准测试。三个核心发现:GLM 5.2 等开源模型已能处理最高难度任务,质量与 Opus 4.8 无统计显著差异,成本仅 $1.28/任务 vs $1.94;按 token 定价是糟糕的成本指标,大模型 token 效率更高所以整体成本可能更低;调用框架对成本的影响高达 2 倍以上,Pi 比 Claude Code 少发 3 倍上下文。

行业与安全

GitLost:提示注入让 GitHub AI Agent 泄露私有仓库

Noma Labs 发现 GitHub 新 Agentic Workflows 中存在严重的提示注入漏洞,命名「GitLost」。攻击者只需在公共仓库创建特制 Issue,就能诱导 AI Agent 静默提取同一组织下私有仓库的数据并公开回复。漏洞已通过负责任披露流程提交给 GitHub。当 AI Agent 开始自动处理用户输入时,提示注入从理论威胁变成了实际攻击路径。这次是 GitHub,下次可能是别家。

Claude 登陆 FedRAMP High,Fable 5 封禁前后的数据变化

Claude Code 和 Claude Cowork 正式在 FedRAMP High 授权环境中 以 Beta 版提供。配备管理员配置控制、部门支出管理、防篡改审计日志。在 Fable 5 出口管制风波后,Anthropic 向政府纵深推进一步,战略意味不亚于产品本身。

说到 Fable 5,KiloBench 跑了一份揭示真相的数据:在首发日(6/9)和回归后(7/4),分别对同一套 445 个会话做了基准测试。封禁前约 20% 会话被直接拒绝;封禁后约 22% 触发干预,但大多数变成静默回退到 Opus 4.8,任务照常完成,用户可能完全不知道是哪个模型在干活。这是首个被政府勒令下架并以谈判后行为回归的前沿模型。「你用的是哪个模型」这个问题,从现在起也部分取决于政策,不只看技术指标。

GPT-5.6 如何改变知识工作:从「亲自完成」到「养护系统」

Every 的 CEO Dan Shipper 写了篇分析:GPT-5.6 是第一个能可靠运行完整知识工作循环的模型——扫描信息、转化为待定决策、执行批准任务、通过反馈自我改进。你的角色从「亲自完成」变成了「养护系统」(tending the loop)。他开源了 Tend prompt 和代码仓库,让非技术用户也能构建自动化工作流。与 Fable 相比,GPT-5.6 更快更便宜,对非技术用户更友好。这可能比任何基准分数都更能说明 5.6 的实际价值。


这一周给人最深的印象是:开源与闭源的能力差距正在肉眼可见地缩小。竞争的护城河从纯模型能力转向了生态整合:渠道、工具链、定价、开发者体验。但更让我在意的是 J-space 的发现:我们在造更聪明的 AI 的同时,也在学着看清它的内部。这或许才是真正的进步。

下周见。