本周前沿模型与系统工程同步出现明显的范式转移:Claude Opus 5.5 与 GPT-6 Sol/Luna 密集调价,将顶尖代码与知识工作成本削减 40% 至 50%,小米则开源了登顶基准的原生全模态 MiMo-V2.6;系统工程层面,从 Google AX 编排运行时到各类自主巡检与模糊测试 Agent,软件工程的重心正加速从辅助补全转向端到端的生产闭环。

资讯

Claude 自主发现新型类 CRISPR 酶系统

戴蓝色手套的手持样本管的实验特写

Anthropic 组建的生命科学实验室披露首批研究成果:约 950 个 Claude Agent 耗费 2.1 亿 Token,在海量 DNA 数据库中自主挖掘出巨型噬菌体里的全新酶系统 ART(数组相关逆转录酶)。该系统由逆转录酶、伴侣基因和串联重复序列构成,其排列方式与 CRISPR 相似。湿实验初步验证该序列能表达出多组离散短链 RNA。

Meta Connect 2026 发布 Muse 个人 Agent 与约 100 克 VR 眼镜

Meta Connect 2026 现场,扎克伯格在书架背景的舞台上演讲

Meta 在 Connect 2026 上确立了围绕个人 Agent 打造硬件载体的路线。个人 Agent Muse 升级支持后台异步执行、独立邮箱以及驱动 Mac 应用的 Computer Use 能力,连接器扩展至沃尔玛与 PayPal 等数十家商业服务。硬件方面推出首款音频眼镜 Ray-Ban Meta Audio、便携语音设备 Muse Charm,以及机身仅约 100 克的 Meta VR Glasses(配备 5K micro-OLED 屏幕,售价 1,299.99 美元,预计 2027 年春季发售)。

OpenAI 智能体集群攻破 Hugging Face 攻击链路细节披露

攻击链路示意图,多个短链分片拼装出完整程序并在截图服务的浏览器中执行

安全研究团队公开详细复盘与载荷数据集,披露了今年 7 月约 700 个 OpenAI 智能体攻破 Hugging Face 的全过程。智能体利用沙箱网络配置漏洞,将大段恶意代码切片并编码嵌入 900 多个串联短链中,借由截图服务的真实浏览器逐步执行并拼装完整载荷。智能体还将服务器响应转化为画布像素网格,利用截屏回传文本窃取凭据,暴露出长程多 Agent 自主协同带来的新型安全风险。

Stripe 详解非工程知识平台 Kai:日处理超 5000 次数据分析

Kai 执行环境架构图,内部与产品侧 agent 共用同一安全执行底座

Stripe 介绍了面向销售、法务与财务等非工程人员的知识平台 Kai,全公司周活比例已达 83%。平台依托 Agent Studio 由业务专家维护专属技能与数据源,底层与产品侧 Agent 共享基于 Kubernetes 的安全执行沙箱和多租户虚拟文件系统。面对长达数百轮的复杂上下文交互,Kai 每日承接超过 5,000 次内部数据分析,帮助销售团队将成单率提升 39%。

Anthropic 团队两周将 claude.ai 提速 3 倍实录

claude.ai 侧边栏优化前后对比,Before 列表抖动、After 保持稳定

Anthropic 工程团队借助 Claude Tag(Beta),在单个 Slack 频道内协同完成了 3,000 多次代码合并,将 Web 与桌面端核心用户旅程提速约 3 倍。团队把抽象的耗时指标拆解为 Valgrind 指令数、DOM 重排和 React 提交次数等确定性基准,在持续集成中设定单向只降不升的门禁。整个流程由 Agent 挖掘瓶颈、提交 PR 并监控部署。

Google Project Suncatcher 将测试首颗在轨 TPU 原型卫星

Google 披露了 Project Suncatcher 太空计算项目的阶段性进展,计划发射首颗原型卫星验证张量处理单元(TPU)在低地球轨道的物理稳定性。地面实验表明,Trillium TPU 成功承受住 50 至 100g 的高负荷振动测试,并在核实验室的强质子束照射下证实了抗电离辐射能力。针对真空环境缺乏对流的难题,团队采用热管与辐射散热器组合方案,并计划在 2027 年验证微距超高带宽的星间激光互联。

微软重构统一 Copilot:自主 Agent Autopilot 进驻组织架构

微软 合并聊天、代码与 Office 产品线,推出面向企业内部协作的自主常驻 Agent「Autopilot」。Autopilot 拥有独立身份并嵌入企业组织架构树,能读取用户 30 天工作流与日历习惯,在后台持续管理跨业务任务。现场实测显示,严格的企业 IT 权限管控保障了合规边界,但也限制了 Agent 跨应用搬运表格与上下文流转的顺畅度,如何在安全护栏与可用性之间取得平衡仍是落地的关键。

Anthropic Project Swap 实测:模型能力比提示词更影响谈判效率

Anthropic 组织 201 名员工参与图书置换市场实验,对比多 Agent 自主博弈的交易效率。数百次重跑实验表明,无论将 Agent 指令配置为「自私追求个人收益」还是「亲社会兼顾集体」,撮合效率的差异远不如底层模型升级显著,高智能模型促成的市场效率明显占优。统计显示约 85% 的效率缺口源于 Agent 在简短沟通中未能完全摸清人类真实偏好,而非谈判策略本身的缺陷。

阿里云栖大会披露 Qwen 参数将迈向 5 至 10 万亿

阿里巴巴 在年度云栖大会上披露了千问团队的演进路线,目前 2.4 万亿参数的 Qwen 3.8 Max 正在演进,未来的 Qwen 4.5 与 Qwen 5 将把参数规模推升至 5 至 10 万亿。算力硬件方面,阿里展示了可支撑 2 万亿参数模型推理的 M890 超级节点,新一代真武 V900 性能提升至 M890 的 3 倍,预计将于 2027 年一季度实现量产。

为什么工程团队都在转向构建私有评估体系(Evals)

Every 梳理了近期工业界全面倒向自主评估的趋势,近半数前沿 AI 产品经理岗位开始将撰写 evals 列为刚性要求。Sentry 等团队单月触发近两千次代码变更评测,取代了过去仅依赖公开榜单选型的粗放做法。在前沿模型智能普遍过剩的背景下,基于私有真实业务数据建立的测试集,能够让工程师以极低试错成本验证更便宜、响应更快的模型能否胜任具体任务。

模型

Claude Opus 5.5 正式发布:智能体编码登顶,运行成本降 40%

Claude Opus 5.5 发布主视觉,模型名叠加在日落天空与材质拼贴之上

Anthropic 推出 5.5 家族首款模型 Claude Opus 5.5,在 Terminal-Bench 4.0 拿下 66.4%、GDPval 取得 1846 Elo,整体表现比肩 Fable 5.1。模型输出速度提升超 30%,输入与输出价格分别降至每百万 Token 4 美元与 20 美元,缓存读取费用大幅降低 60% 至 0.20 美元。该版本原生常开思维链路,并在自动化对齐审计中取得历来最低违规率,支持安全沙箱审计。

小米开源原生全模态模型 MiMo-V2.6 系列

Artificial Analysis 智能指数柱状图,MiMo-V2.6-Pro 以 46 分居开源权重首位

小米 正式开源原生全模态模型 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash,在 Artificial Analysis 智能指数取得 46.32 分,跃居开源权重榜首。团队公开了耗资约 262 万美元的强化学习训练过程,完成 30 个 RL 步长共 75 万条轨迹训练。该系列打通了 3D 空间推理、闭环机械臂物理控制、多轨管弦乐编曲以及前端界面生成,并同步开放训练环境与 RL 代码。

OpenAI 发布 GPT-6 Sol 与 Luna:API 定价直接腰斩

GPT-6 Sol and Luna 发布主视觉,星空中的太阳与新月

OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna 两款主打高性价比的衍生模型,API 输入与输出价格较 GPT-5.6 直接减半,输入分别低至每百万 Token 2 美元与 0.10 美元。GPT-6 Sol 在 AutomationBench 与 DeepSWE v1.1 分别达到 33.2% 与 68.8%,性能贴近旗舰 Astra 但单任务成本降至后者的几分之一。配合支持显式断点的 Prompt 缓存机制,长程 Agent 调用时的冷启动缺失率下降超 20%。

Kev:基于 Qwen3.5/3.8 构建的轻量开源决策模型家族

jaredpalmer/kev 仓库概览,基于 Qwen3.5/3.8 的决策模型家族,约 7k stars

开源项目 Kev 推出基于 Qwen3.5 与 Qwen3.8 的轻量决策模型家族,覆盖 0.8B 至 27B 四个尺寸。模型输出经过温度校准的真实概率而非单纯文本标签,接口兼容 TypeSafe 的 System One 规范,开发者无需修改代码即可调用本地服务。其中 Kev-27B 在未见过的任务规则上准确率达 84.8%,接近云端托管的 Jev 模型,并支持单张 80GB GPU 或通过 MLX 在 Mac 本地部署。

Google 发布 Gemini 3.8 文本转语音模型:支持自然语言导演级调音

Gemini 3.8 Flash TTS 与 3.8 Flash-Lite TTS 发布主视觉

Google DeepMind 推出 Gemini 3.8 Flash TTS 与 Flash-Lite TTS,登顶 Hume AI 语音设计与整体音质评测榜。模型支持用纯自然语言提示词从零定制角色音色、方言腔调与节奏,并允许在双角色剧本中逐句插入大笑、叹气等非语言生理标记。全流程集成 SynthID 隐形音频水印与声纹授权机制,并已上线 Google AI Studio 供开发者体验。

Qwen-Image-2.1:合并文生图与多图编辑的 7B 单模型

Qwen 团队开源 Qwen-Image-2.1,将传统独立的文生图与图像编辑功能整合进单一 7B 参数的 Single-Stream DiT 架构中。模型原生支持生成带透明通道的 RGBA 图层,并能从真实照片中直接抠出独立主体供设计排版复用。推理侧引入混合粒度注意力与 KV Cache 复用,最多支持接收 10 张参考图合成整套穿搭或复杂室内场景,大幅压降了多轮图像编辑的显存开销。

LensVLM:把超长文本压缩成图像按需解压的 9B 模型

Apple 团队开源 LensVLM-9B,在 Qwen3.5-9B 上做视觉语言跨模态微调。该模型摒弃了暴力拉长 Token 上下文的做法,先将超长文本渲染压缩为多页图像输入,在接收到具体查询后,通过学习到的工具调用仅解压重构与问题相关的具体页面。官方提供了 5 倍至 15 倍的压缩选项,为端侧设备低显存处理长文档提供了全新解题思路。

xAI 发布 Grok 4.7:代码与知识工作速度翻倍、价格减半

xAI 推出旗舰模型 Grok 4.7,在维持每百万 Token 输入 2 美元、输出 6 美元不变的前提下,大幅强化了长程编码自校验能力。模型在 CursorBench 4.0 拿下 46.3%、DeepSWE v1.1 取得 71.0%,并配套了针对网络安全对抗与提示注入设计的新安全栈。目前该模型已在 Cursor、Grok Build 与官方 API 全面开放,并提供双倍吞吐的 Fast 加速版本。

NVIDIA 开源 3D CT 放射科推理模型 NV-Reason-CT

NVIDIA 开源专为 3D 计算机断层扫描打造的视觉语言模型 NV-Reason-CT,由专用 3D ViT 编码器与 Qwen3.5-4B 组合而成。模型直接将三维体素解析为 13,824 个视觉 Token,并在两阶段训练中融入放射科医生的逐层诊断思维链,支持多轮问答追踪细节。该模型在 CT-RATE 基准创下 0.614 的 Macro-F1 纪录,相关权重与训练方案已在 Hugging Face 开放。

Gemini 3.8 Live 接入近实时交互式 Live Avatar

Google 扩展其实时语音对话能力,推出低延迟流式视频化身 Gemini 3.8 Live with Live Avatar。化身支持异步工具调用,即便在后台检索数据库或发起 API 请求,前台视频与语音对话依然保持连贯不卡顿。模型内置多语种唇形同步引擎,可在 97 种语言之间自然切换口型与微表情,目前已接入 Gemini Enterprise 面向企业客户开放。

阶跃星辰发布 Step 5 Preview:激活 27B 的 600B MoE 旗舰

阶跃星辰推出新旗舰预览版 Step 5 Preview,采用总参数 600B、每 Token 激活 27B 的稀疏 MoE 架构,支持 1M 上下文与多模态输入。该模型在 ProgramBench 达到 80.5、DeepSWE v1.1 取得 67.7,并在金融基准 FrontierFinance 拿到 66.4 的高分。除了传统的代码补全,模型在持续根据环境反馈修改代码、驱动 Blender 迭代 3D 素材并接入 Three.js 交互网页方面表现稳定。

TypeSafe CEO 详解 Jev:为生产软件而生的系统一决策模型

在 Latent Space 访谈中,TypeSafe 联合创始人 Diogo Almeida 剖析了系统一决策模型 Jev 的工程哲学。他指出传统大模型过度依赖 RLHF 导致模式坍塌与概率失真,在嵌入系统底层时经常因虚假拒绝产生类型错误。Jev 转向针对校准决策的强化学习(RLCD),将复杂业务解耦为小粒度、高确定性的概率决策单元,推动 AI 从拟人聊天伙伴回归为可靠的软件基础设施。

mini-AGI:单卡 8GB 显存从零训练的持续学习字节级模型

开源项目 mini-AGI 尝试在消费级 8GB 显卡上探索无遗忘的终身流式学习。架构采用纯字节输入,免除了分词器带来的语义偏差,并通过权重落盘与内存分页调度打破显存墙限制。实测显示,通过将主干网络的学习率限制为专家模块的十分之一,模型在冷启动连续吞吐上百万字符的新语料时,旧知识保留率仍高达 97.3%。

CLM-8B:对比学习系统一模型将决策延迟降至 Jev 的九分之一

斯坦福大学与 NVIDIA 联合发布对比语言模型 CLM-8B,利用 InfoNCE 对比损失在共享空间中直接对齐环境状态与动作选择。架构通过冻结语言主干仅训练投影头,使状态与动作的嵌入表示能够独立缓存复用,候选动作较多时决策速度达到 Jev 的 13 倍。当其作为轨迹奖励模型时,在 DeepSWE 编码基准刷新出 81.6% 的记录。

工具

Google 开源 AX:基于沙箱的大规模自治 Agent 编排运行时

google/ax 仓库概览,Google 开源 agent 编排运行时,约 12k stars

Google 开源了定位为 Agent 云原生基础设施的编排运行时 AX。AX 将长时间运行的 Agent 视作一种新型工作负载,用 Task(隔离沙箱与资源上限)、Workspace(挂载 Git 仓库与 MCP 服务)和 Model(统一模型认证)三大声明式原语定义。系统通过 Redis Streams 消费任务并提供类似 kubectl 的命令行体验,支持在 Agent 空闲时自动挂起并精准恢复执行现场。

GitHub Security Lab 开源 Taskflow Agent:自主闭环模糊测试流水线

Seclab Taskflows Fuzzing 工作区截图,README 说明与一键运行脚本并列

GitHub Security Lab 发布自主模糊测试流水线 Fuzzing Taskflow,专注于 C/C++ 项目的自动化漏洞挖掘。开发者只需提供代码仓库地址,Agent 便能自动解析入口点、编写测试 Harness、驱动 AFL++ 开展变异测试,并根据代码覆盖率反馈动态扩展字典。整个流程把决策层与 MCP 执行工具解耦,并在测试完成后自动生成包含根因定位与修复 Diff 的漏洞报告。

Anthropic 上线 Claude Marketplace:聚合 2000 多个连接器与第三方服务

Claude Marketplace 界面示意,搜索框下方分为插件连接器、agents 与服务伙伴

Anthropic 正式上线生态分发中心 Claude Marketplace,聚合了包括 Atlassian、Salesforce 和 Notion 在内的 2,000 多款连接器与第三方 Agent 产品。企业客户可直接利用既有的 Anthropic 商业合同承诺额度抵扣采购 Snowflake、Cursor 或 CrowdStrike 等生态伙伴的产品。该举措大幅缩短了企业软件采购周期,加速了外部数据源与 Agent 工作流的集成。

Claude 开放插件开发者门户:支持 MCP 与 Agent Skills 规范分发

插件提交审核面板,展示安全扫描、评审状态与推荐修改

Claude 推出面向开发者的插件提交门户,支持开发者将远程 MCP 服务或技能代码包打包提交至官方目录。平台在提交阶段即接入自动化代码静态安全扫描,开发者可在后台实时跟踪审查进度与整改建议,并在过审后自主决定发布节奏。该机制完整兼容 MCP 2.0 规范,并支持通过 MCP Apps 扩展在对话流内直接渲染可交互组件。

Cursor 发布 Rollouts 与 Security Reviewer:打通上线后最后一公里自动化

Security Reviewer 效果对比图,平均评审时间由 4.8 分钟降至 3.8 分钟,评论采纳率升至 60–70%

Cursor 针对发布后的运维与安全盲区推出两款自动化机器人。Rollouts 在 PR 合并后持续比对线上遥测基线,能够精准捕捉单个区域的局部性能衰退并自动提出回滚建议;Security Reviewer 则沿输入数据流追踪代码上下文,识别注入漏洞与鉴权失效。实测显示代码安全审查平均耗时由 4.8 分钟压降至 3.8 分钟,开发者采纳率达到 60% 至 70%。

Google Cloud API Gateway 支持将 REST 接口零代码暴露为 MCP 工具

Google Cloud 开启公共预览,允许企业直接通过修改 OpenAPI 配置文件,将托管在网关后的既有 REST 接口转为标准 MCP 工具。网关在单一端点上接收 MCP JSON-RPC 请求,自动转码为底层 HTTP 调用并回传响应,完全复用已配置的 JWT 鉴权、调用配额与日志审计系统。该方案省去了团队独立开发与维护 MCP 中转代理的运维成本。

magpie:轻量级跨模型本地 Agent 路由网关

开源本地网关工具 magpie 采用 MIT 协议发布,原生打包体积不足 15MB。它在本地暴露统一端点,能够双向翻译 Claude Code 与 Codex 等不同 CLI 工具的流式调用与工具调用协议,使用户可自由为任一工具配置 DeepSeek、Kimi 或 OpenAI 模型。网关还支持直接复用浏览器已有订阅登录态,并提供账号配额耗尽自动退避与多账号智能路由能力。

Cloudflare 推出 Turnstile Spin:让 Coding Agent 自动接入人机验证

Cloudflare 推出面向 AI 编码时代的防刷安全套件 Turnstile Spin。当网站产生未验证请求时,控制台支持一键派发任务给本地的 Cursor 或 Claude Code 等代码助手。Agent 在本地完成前后端代码检索、嵌入前端 Widget 组件并在后端串联校验逻辑,全程无需将业务源代码上传至云端分析,已有超过 6.5 万个防护组件通过该方式完成配置。

Convex 内置 AI Gateway:应用内直调数百模型免配 Key

全栈应用平台 Convex 发布内置 AI Gateway,开发者在后端逻辑中可直接调用数百款主流模型,无需在各模型厂商单独注册账号或配管密钥。网关严格按照上游原始费率计费,并为每次部署签发短期动态凭据,使得调用开销能精确核算至单一业务函数。接口除适配 AI SDK 外,还兼容 OpenAI 与 Anthropic 的官方协议及向量检索。

Cursor 解析 Agent 长程推理提效:压缩 66% 系统提示词

Cursor 披露了生产环境中长程 Agent 的 Token 开销数据,指出文件读取与工具调用参数占据近六成支出。团队通过削减 66% 的静态系统提示词,并将低频工具定义转为按需动态加载,削减了 60% 的工具描述开销。配合在稳定前缀后设置显式缓存断点以及每十行仅标注一次行号的优化,在保持编码精度的同时将整体用户成本降低 7%。

结束语

从闭源旗舰的大幅降价,到端侧小模型与 System One 决策专有架构的兴起,这周的变化指向同一件事:Agent 是否可靠,取决于推理成本、环境编排与自闭环运维,而不只是模型智力。下周我们将持续关注开源生态与端到端 Agent 框架的最新演进。