OpenAI 发布新旗舰 GPT-6 Astra,Anthropic 展示了 Claude 耗时 11 天形式化费马大定理的机器证明;而在工程端,从 104 GB 本地 MoE 推理到多智能体调度框架,端侧与 Agent 生态正快速走向成熟。

资讯

万次运行测 Agent 偏好

Armature 团队构建了 75 个仿真代码仓库,在隔离沙箱中进行了近 1.7 万次测试,量化记录 Claude Code、Codex 与 Cursor 在面临第三方需求时如何挑选并安装依赖。不同智能体表现出截然不同的行为模式:Codex 在 94% 的会话中依赖网络搜索,Claude Code 则偏向内部先验且自研实现比例几乎是前者的两倍。数据显示被提及最多的工具并不等于最终采用,供应商在文档细节上的差异往往直接左右了智能体的选择。

AA 指数 4.2 引入防刷榜

Intelligence Index 与每任务输出 token 消耗的关系图及模型排名

评测机构 Artificial Analysis 正式推出 Intelligence Index v4.2,将原定于 v5 的复杂智能体评测提前上线。新版本移除了已经饱和的 GPQA Diamond,加入跨千页文档推理的 GDP.pdf 与自研知识工作集 AA-Briefcase,并将私有盲测集权重提升至 40%。最新榜单由 Claude Fable 5.1 与 GPT-6 Astra 领跑,Astra 在输出 token 消耗效率曲线上的表现尤为优异。

Claude 形式化费马大定理

Claude 将费马大定理拆解为各子定理的证明依赖关系图(DAG)

Anthropic 科学团队宣布,借助内部模型基本自主完成了费马大定理的完整机器验证证明。多个 Claude 智能体在 11 天内编写了 1300 万行 Lean 代码,证明了约 3 万个中间定理,代码规模超过数学核心库 Mathlib 的五倍。团队通过 Prove2Me 平台构建定理有向无环图(DAG)以解决长周期协作中的状态丢失问题,展现了 AI 在处理前所未有规模的形式化数学验证时的协作潜力。

模型

Runway 发布界面世界模型

Runway Solaris 提出了一种被称为「界面世界模型」的全新思路,它不再把设计思路转译为 HTML 或前端代码,而是直接实时逐帧渲染出可交互的用户界面。模型针对半秒内的交互延迟和全会话状态一致性进行了底层改造,保证按钮点击、滚动以及文字输入能够得到平滑响应。这项技术跳出了传统搜索引擎与静态助手的限制,让操作系统在使用过程中动态生成界面成为可能。

Gemini 升级视频理解能力

Google 针对最新的 Gemini 3.7、3.6 与 3.5 Flash 系列推出了智能体式视频理解机制。与每秒固定采样一帧的静态处理不同,该架构让模型调用原生工具在长视频中自主搜索、快进并局部放大检查关键帧。在大幅提高推理精度的同时,该功能将长视频分析的 token 消耗最高降低 88%,综合调用成本缩减多达 66%。

发布空间模型 Atlas

Atlas 世界模型生成的菜园机器人场景,用于演示相机控制

李飞飞创立的 World Labs 发布了新一代空间智能模型 Atlas,从底层预训练原生打通了文本、图像、视频与 3D 几何。作为一个多模态自回归扩散系统,Atlas 将所有输入投影至统一的空间上下文,支持像素级精准运镜并生成长达 1 分钟、1440p 的视角一致性视频。除了单图与多图的三维物理场景重建,它还能为具身机器人规划提供高保真的真实到仿真模拟环境。

Fable 5.1 双模型发布

麦哲伦号雷达拍摄的金星火山,Fable 5.1 据此重建高分辨率高程图

Anthropic 正式推出 Claude Fable 5.1 与针对网络防御及生命科学的 Claude Mythos 5.1。两款模型共享相同推理底座,Fable 5.1 在常规场景下降低了约 25% 的综合资费,针对重度智能体调用的缓存读取最高可节省 45% 成本,同时防护误报减少了 60%。新引入的企业前沿防护架构支持客户在自建云设施内驻留敏感数据,为严苛商业场景提供了真正意义上的零数据留存支持。

Fal 突破实时视频生成延迟

生成式多媒体长期受困于漫长的渲染耗时,Fal 开发的 H3 Max Live 打破了这一瓶颈。团队基于 Minimax H3 架构完成二次后训练与系统级算子精简,实现了可连续交互的超低延迟视频推流。这项升级让创作者在调整提示词或控制参数时能够即刻看到动态画面的实时反馈,摆脱了以往即便是单帧生成也需要等待数秒的体验割裂。

首个电磁学基础模型发布

Arena Physica 发布了面向电磁领域的专业基础模型 Heaviside-1,并同步上线了三维场查看工具 Atlas Fields Studio。该模型拥有 3.5 亿参数,直接在三维空间几何、介质特性和物理场分布上完成训练,能直接输出全空间的三维近场矢量。与传统 Ansys HFSS 等商业数值求解器相比,其计算速度提升了约 10 万倍,预测误差仍能稳定控制在 1 dB 以内。

谷歌发布 Gemini 3.8

Gemini 3.8 Flash 在 DeepSWE V1.1 上的通过率与每任务成本对比

Google 再次刷新 Flash 系列,推出 Gemini 3.8 Flash 以及安全专用版 Gemini 3.8 Flash Cyber,延续百万输出 token 3.75 美元的优惠定价。3.8 Flash 增强了深度软件工程和长周期多步推理表现,在 DeepSWE v1.1 基准上刷新了同价位成绩。防御特化版 Cyber 则通过专享计划向可信机构开放,在自动化漏洞排查与 CWE-Bench 漏洞修复测试中达到了 Pareto 前沿。

谷歌发布全球天气 AI 模型

Google DeepMind 与 Google Research 联合发布了新一代全球气象大模型 WeatherNext 3,直接基于实时地球静止卫星云图与地面稀疏气象站数据进行训练。模型绕过了传统数值物理天气预报长达 6 小时的数据延迟,将关键地表变量网格细化至 5 公里,空间清晰度提升 5 倍。经独立评测,其中期降水预报精度提升最高达 60%,目前已无缝接入 Google 搜索、地图与 Gemini。

GPT-6 Astra 发布

GPT-5.6 Sol 与 GPT-6 Astra 并排构建个人职业网站的效果对比

OpenAI 推出全新旗舰模型 GPT-6 Astra,在计算机操作、浏览器控制、复杂代码重构与科学探索上全面刷新基准。Astra 在高难度数学竞赛 FrontierMath Tier 4 上取得了 98% 的成绩,并协助人类研究者将大素数间隔理论界限从 246 缩小至 186;在 ARC-AGI-3 上达到 99.9%,ExploitBench 达 100%。针对桌面操控任务,Astra 耗时较前代缩减约 47%,且在对抗性场景下的未对齐行为率下降到了 2.4%。

IFM 开源 K2 系列模型

K2 Horizon 六个模型尺寸在多项基准上的成绩对比

非营利机构 IFM 以 Apache 2.0 协议完整开源了 K2 Horizon 模型族,涵盖 0.9B 到 375B 稀疏架构的 6 个尺寸,同时公开了 20 万亿 token 的完整预训练配方、训练日志与后训练源码。该系列在注意力层创新引入 MoVA 稀疏值机制,36B 规模下每 token 仅激活 4B 即可逼近稠密 32B 性能。团队还提供了基于扩散蒸馏的 Uno 加速 LoRA 与透明的奖励黑客审计细节,展现了极具深度的开放科学精神。

Qwen 3.8 极速推理

晶圆级芯片厂商 Cerebras 在其公开推理端点上线了 Qwen 3.8 27B,提供约 1500 tokens/s 的极速生成吞吐。官方说明指出,公共端点提供的是未经架构剪枝的原始模型,仅在持久化存储时使用权重非线性量化,计算过程保持全精度展开。这种极端吞吐速度让长文本解析与高频交互式智能体工作流获得了近乎零等待的响应体验。

Muse Spark 模型发布

Meta 团队发布了专注于长周期复杂智能体与编码的 Muse Spark 1.3,在独立基准榜单上跃升至全球第三,逼近 GPT-5.6 Sol 与 Claude Opus 5。扎克伯格宣布该模型后续将开放权重,并推出了允许数据参与训练换取超过 90% 资费折扣的 API 方案。在百万 token 上下文测试中,它展现出高度稳定的长距离信息检索与逻辑连贯性。

工具

ChatGPT 技能清单整理

Simon Willison 利用 ChatGPT Work 自身的导出功能,系统梳理了该工作台暴露给会话的 232 个可调用工具接口与 44 个核心技能脚本。这份公开快照不仅完整复现了 SKILL.md 的指导逻辑,还保留了底层 TypeScript 参数声明,清晰呈现了 OpenAI 在云端工作台中如何协调文件系统、浏览器与外部集成。对于正在构建类似智能体脚手架的开发者而言,这是难得的第一手架构参考。

开源平台 OpenClaw 2

OpenClaw 2.0 浏览器应用界面,展示 Claw Patrol 智能体与消息输入框

由 933 名贡献者合并逾 1.6 万个 PR 的 OpenClaw 2.0 正式面世,完成了涵盖安装流水线、消息收发、记忆持久化与技能管理的全栈重构。新版本将浏览器应用打造为一等公民体验,支持多人协作看板与 Claw Patrol 智能体团队巡检。底层进一步强化了安全隔离与跨会话状态继承,大幅降低了私有化部署多智能体协作环境的配置复杂度。

拆解 ChatGPT Work

技术专家 Simon Willison 撰文深度剖析了 ChatGPT Work 的产品架构与双重形态。他明确指出 Work 实际上包含运行在云端沙箱的 Web 版和基于本地系统的桌面版,前者自带无头浏览器与临时文件系统,后者则能够直接读写本地磁盘并启动系统进程。文章详细厘清了自动执行、持久化边界与安全权限设计,帮助读者准确理解新形态智能体工作空间的运行机理。

Baseten 解析推理前沿

模型服务平台 Baseten 发布深度工程长文 The efficient frontier of LLM inference,将经济学中的有效前沿理论引入大模型推理优化。文章清晰区分了在现有前沿上移动(如批处理大小、量化精度与推测解码的锯齿状权衡)与将前沿整体外推(如 KV 缓存感知路由与前缀共享)两类手段。这套系统框架为团队在延迟、吞吐量和硬件支出之间做科学权衡提供了有力工具。

Mac 本地跑千亿 MoE

开源项目 Slotstream 实现了在 48GB 内存的苹果 Mac 上离线运行 104GB 体积的 Qwen3.8-Flash-Next 混合专家模型。它跳过了必须把全部权重装入内存的传统限制,将大部分参数留在高速固态硬盘中,只按需调度当前活跃专家,在本地跑出了约 12 tokens/s 的可用速度。开发者无需配置云端密钥或臃肿环境,即可直接通过命令行、API 或 Swift 原生库进行接入。

公布电商 Agent 架构

电商 agent 架构图:LLM 循环、工具/技能/界面/记忆与 harness

Anthropic 工程师汇总了过去一年协助零售、旅游与平台企业落地的实践,撰文发布了高转化电商智能体架构与评测指南。指南剖析了以 Claude 循环为核心的技能分发、界面展示协议与状态记忆设计,针对多轮选购中的上下文膨胀与延迟瓶颈给出了具体优化方案。官方同时公开了配套的代码蓝图与评估测试集,为面向终端消费者的商业智能体提供了工业级模板。

Cline 升级千万用户运行时

知名开源辅助编码工具 Cline 详细披露了将其 1100 万开发者用户平滑迁移至全新 SDK 架构的历程。团队把原本深度绑定在 VS Code 插件内的智能体调度逻辑全面剥离,重构为独立、模块化的共享运行时,实测证明外围脚手架对开源开放权重模型的产出质量具有显著放大作用。文章完整记录了从最初发布遭遇严重回滚到后续通过渐进式分流成功上线的复盘经验。

Cursor 支持自管算力运行

AI 编程环境 Cursor 云端智能体 正式支持部署在企业自有的私有算力与动态机器池上。虽然高层编排与会话调度依然由 Cursor 云端统一驱动,但代码拉取、自动化构建与脚本测试均在客户内网的 AWS 账户或本地服务器上执行。这项机制既满足了金融与政企客户代码资产不出内网的合规要求,也让智能体得以充分调用专属私有硬件与专用编译镜像。

GitHub 优化智能体上下文

GitHub 官方博客发文探讨了编码智能体的优化指标,主张应当以任务最终完成质量而非单次工具调用的 token 数作为衡量核心。Copilot CLI 等产品落地了四项针对性改进:去除无实质意义的装饰排版、精简提示指令、将后台作业结果直接打包返回,并保留关键环境信息以防二次检索。线上实验表明,盲目追求简短输出往往迫使智能体发起多余确认,统筹设计才能真正降低任务生命周期成本。

代码生成可漫游三维世界

旧金山联合广场可漫游世界:左为 GPT-6 Astra,右为 Claude Fable 5.1

开源项目 fable51-worlds 展示了一种基于纯代码生成三维场景的全新思路。项目通过 Claude Fable 5.1 智能体蜂群,仅依据一句地名描述或单张实景照片,就能直接编写出全套 Three.js 脚本,输出可在浏览器内自由漫游的虚拟空间。项目中展示了旧金山联合广场与京都街景的实测案例,所有建筑、招牌与绿化均由程序几何生成,无需依赖外部 3D 资产或商业游戏引擎。

WebLLM 浏览器端硬件推理

在 GitHub 拥有近两万星标的开源推理引擎 WebLLM 近期迎来了重要迭代,利用 WebGPU 技术将大模型推理直接带入主流浏览器内部。项目与 OpenAI API 接口标准完全兼容,允许开发者在无需搭建任何后端服务器的情况下,在客户端本地运行各类主流开源大模型,支持实时流式返回与结构化输出。这为开发不依赖第三方 API、兼具隐私安全与即时响应的前端 AI 应用提供了实用的本地运行支持。

Grok Bot 替代智能体栈

产品专家 Claire Vo 在播客中分享了她将日常自动化工作流完全迁移至 Grok Bot 的实战经验。Grok Bot 由 SpaceXAI 打造,界面结合了即时通讯与交互终端,原生集成了丰富的智能体与多账号授权插件。她现场演示了如何设定晨间自动化简报、多邮箱跨账户分流处理以及项目看板跟踪的配置模板,为个体创作者和小型团队落地多智能体协作提供了生动参照。

评测揭示调度框架 17 倍差距

同一模型在 9 种 harness 下的通过率与每任务成本散点图

开源评测基准 FrontierHarness Eval 对 9 款主流智能体调度外壳(Harness)进行了量化横评,实证了在底层模型完全一致的前提下,调度框架对编程智能体表现的决定性作用。在面向真实终端开发任务的测试中,不同脚手架导致的任务成功率与单次通过成本差异最高达 17 倍。测试数据证明,精心设计的提示词注入与执行反馈闭环,其带来的效能收益不亚于升级底层模型参数。

纯 C 语言老电脑跑 744B

独立开发者开源了基于 C11 从零编写的纯 CPU 推理引擎 PulsarForge,成功在仅配备 32GB 内存的 2018 款老式笔记本上加载并运行了 7440 亿参数的超大 MoE 模型。该项目完全不依赖 GPU,借助普通外置固态硬盘以极小内存开销完成权重调度,在 Windows 与 Linux 上保证了逐位精确的输出结果,并公开了详尽的底层内存排布设计与踩坑复盘。

GitHub 开启并行会话

GitHub 官方发布了面向初学者的 Copilot 并行智能体会话实践指南。新系统基于 Git worktree 机制为每个任务分配隔离的工作区,开发者可以像在自助洗衣房开启多台设备一样,同时调度多个 Copilot 智能体去分别修复缺陷、补写单元测试或清理文档。各会话并行推进且互不干扰,显著压缩了开发者单线程串行等待的时间成本。

Spotify 削减九成消耗

Portal 将大量 I/O 结果压缩,使 Claude token 消耗从 4 个降到 1 个

Spotify 工程团队分享了其内部工具 Portal 的实践:把 Claude Code 面临的大量 I/O 苦力工作外包给低成本模型。系统定义了临时运行的轻量模式,指派 Gemini 2.5 Flash 负责通读海量目录并提取结构化摘要,或是直接生成繁重的样板脚手架代码,从而让主力 Claude 模型专注于高层次架构决策。在复杂的 Java monorepo 代码库中,该策略将主力模型的 token 消耗平均削减了 90%。

Amp 提供云端交互桌面环境

AI 编码平台 Amp 为其云端工作区引入了名为 Desktop 的新功能,在每个运行线程中配备了高分辨率、可实时远程操控的 Linux 桌面。智能体不仅能够执行命令行指令,还能在 LibreOffice 中排版检查文档、测试带有图形界面的原生应用或进行视觉前端验证。开发者也可以随时接管鼠标键盘,直观检验计算机操作类长任务的中间执行状态。

Cursor 打造会计智能体

AI 会计自动化初创公司 Basis 详细复盘了其基于 Cursor 打造自主处理复杂财务工作流智能体的经验。月末结账与报税审计往往涉及数百个紧密相扣的推导决策,上下文稍有偏差就会导致错误累积,Basis 将智能体所需的提示词、工具定义与业务规则视同核心代码,借助严格的版本管理与测试集维护长周期推理的一致性,确保了自动化产出的可复核性。

文件夹即 Agent 架构思路

Every 旗下 Cora 项目负责人 Kieran Klaassen 撰文反思了多智能体架构的实践陷阱,提出了「文件夹即 Agent」的极简设计哲学。在尝试让智能体自发协同的复杂网络多次碰壁后,他意识到 Agent 的实质就是一个通用模型配上恰当的工程上下文。通过在项目文件夹中规范固化团队标准、运行手册与技能脚本,44 个结构清晰的独立文件夹轻松取代了脆弱易崩的动态协调蜂群。

GitHub 推出多模型编排

GitHub 官方推出了名为 Project HydraFusion 的全新研究预览版,将多模型协作编排机制引入 Copilot。系统会在运行时把复杂的编码任务拆解为执行规划,自动在跨厂商的多款模型之间调度分工,由专长模型分别负责草拟、交叉代码审查与重构修正。所有调度逻辑均在后台无感完成,开发者无需手动切换不同模型即可获得兼顾延迟与质量的综合结果。

EEBench 建立电路基准

针对大模型开始涉足硬件工程的趋势,评测团队发布了基于真实物理仿真的测试基准 EEBench。研究提出,与其让智能体在图形化 CAD 界面中消耗大量坐标与操作上下文,不如让其直接编写 atopile 声明式电路代码。该基准通过在仿真环境中切断电源,精确测量电路在断电瞬态下的实际电容衰减与供电维持表现,为客观检验硬件级 AI 设计水准提供了扎实判据。

单一 API 聚合视觉模型

开源开发者发布了 VLM Run Gateway,旨在打破通用文本路由网关与多模态视觉模型之间的隔阂。该网关提供与 OpenAI 标准完全兼容的单一端点及 MCP 服务器,统一路由并托管了 21 种主流开源 OCR、图像标注与视觉多模态大模型。对于需要集中处理复杂图表、跨模态审查与文档解析的开发者而言,无需自行维护多套碎片化的视觉服务部署。

英伟达 PAIR 汇集闲置算力

英伟达发布开源工具 Personal AI Router (PAIR),能够将局域网内的闲置设备聚合为个人推理集群。该工具兼容 RTX 20 系列以上显卡、RTX 专业卡及苹果 M4 芯片,通过六位配对码和双向 mTLS 加密构建可信通信链路。当检测到用户启动游戏等高负载应用时,设备会自动平滑退出集群,有效盘活了家庭与工作室内的多机闲置算力。

Moadim 本地调度智能体

开源项目 Moadim 为开发者提供了一个极简的智能体循环调度引擎。它将提示词、定时 Cron 规则与指定的底层智能体(支持 Claude、Codex、Hermes 等)绑定为一个自主循环,每次触发时都在干净的独立沙箱中启动并在任务完成后妥善回收。引擎完全基于本地系统守护进程运行,不依赖任何云端队列,并同时提供漂亮的 Web 界面、REST 接口与 MCP 协议支持。

结束语

从 GPT-6 Astra 的全面跃升到 Claude 攻克费马大定理的机器证明,大模型的智力边界依然在向上延伸;而在技术快速演进的过程中,真正决定落地效率的,往往是端侧轻量化推理引擎、外围 Harness 调度框架以及清晰的上下文工程。我们下期再见!