这是疯狂的一周。NVIDIA 在 Computex 上发布了三款重量级开源模型(世界模型 Cosmos 3、550B 大语言模型 Nemotron 3 Ultra,以及个人 AI 超级芯片 RTX Spark),GitHub Copilot App、Devin Desktop 和 Claude Code Dynamic Workflows 在同一天打响 Agent 操作系统之战,而 Anthropic 悄悄向 SEC 递交了 S-1,准备成为史上最大科技 IPO 之一。外加 Google 宣布 800 亿美元股权融资、以每月 9.2 亿美元租用 SpaceX 算力……这场 AI 军备竞赛的规模已经超越了任何人的想象力。


资讯

Anthropic 秘密递表,AI 行业迎来里程碑级 IPO

AI 行业最大的未上市公司终于要上市了。Anthropic 向 SEC 秘密提交 S-1 注册声明,为其普通股首次公开募股做准备。这是继 9650 亿美元估值完成 H 轮融资后的又一步棋。拟发行股数和价格区间尚未确定,上市时间取决于 SEC 审查进度和市场条件。考虑到 Claude Code 和 Claude 系列模型在开发者社区中的统治地位,这场 IPO 的市场热度不会低于当年 Snowflake 或 Airbnb 的上市盛况。

这场 IPO 背后有一组更惊人的数字。Alphabet 宣布 800 亿美元股权融资,全部投入 AI 基础设施。同一天,Google 与 SpaceX 签署了每月 9.2 亿美元的算力合同,从 2026 年 10 月到 2029 年 6 月租用约 11 万颗 NVIDIA GPU。Alphabet 全年资本支出已超 1800 亿美元,明年还会"显著增加"。Google 和 SpaceX 甚至已经在讨论建设轨道数据中心。AI 已经从"烧钱"升级到了"烧一个国家 GDP"的级别。

OpenAI 模型全面上线 AWS,企业合规的最后一道障碍被清除

OpenAI 前沿模型和 Codex 正式在 AWS Commercial 及 GovCloud 区域 GA。通过 Amazon Bedrock 原生集成,数百万 AWS 客户可以用已有的安全、合规、计费流程直接调用 OpenAI 模型。Codex 也同步上线 Bedrock——这个每周已有超过 500 万人使用的编程 Agent,现在可以在企业自己的 VPC 内运行。OpenAI 还预告了 Daybreak 网络安全模型将登陆 AWS,目标是帮助防御者更早发现风险、更快响应。

对于一直想用 OpenAI 但因合规顾虑而观望的企业来说,这是决定性的转折。不用再纠结自建 API 网关和安全审查——直接在 AWS 控制台里选模型就行。

微软 Build 2026:七款 MAI 模型 + 109 页技术报告

微软在 Build 大会上一次性发布了七款 MAI 模型。MAI-Thinking-1 是 35B 活跃参数的 MoE 推理模型,256K 上下文,AIME 2025 达 97%,SWE-Bench Pro 53%,用户偏好超过 Sonnet 4.6。109 页技术报告最让人意外的细节:零合成数据、零蒸馏——所有训练数据来自精心配比的 NLL 混合物(50% 代码,17.5% STEM,17.5% 数学,10% 通用知识,5% 多语言),RL 从一个完全没有推理经验的 checkpoint 起步,AIME25 分数从 <20% 直接跳到 >95%。同时发布的还有 MAI-Image-2.5(图像编辑领域排名第二)和 MAI-Transcribe-1.5(43 语言语音转文字,每分钟仅 $0.006)。配合 GitHub Copilot App 和 Windows Agent Runtime(Project Solara),微软正在从模型到平台全面铺开 Agent 战略。

Anthropic 公布递归式自我改进报告:AI 正在加速 AI 的发展

Anthropic 发布了一份关于递归式自我改进的重磅报告,数字令人震惊:AI 模型可自主完成的任务时长,大约每 4 个月翻一番——Claude 从 2024 年 3 月的 4 分钟任务时长,到 2026 年已能自主完成 12 小时任务。Anthropic 合并的代码中超过 80% 由 Claude 编写,工程师人均日合并代码量是 2024 年的 8 倍。在 AI 研究方面,Claude Mythos Preview 在实验优化任务中达到了约 52 倍加速,AI Agent 在自主完成端到端研究项目中恢复了 97% 的性能差距。

报告提出了三个可能的未来场景:趋势停滞(可能性不大);持续效率提升(100 人公司做 10,000 人的工作);完整递归式自我改进(AI 系统自主设计继任者,人类角色大幅缩减)。Anthropic 呼吁建立全球协调机制,并计划组织政策制定者、研究者和民间社会对话。

Project Glasswing 扩至 150 家组织,AI 漏洞发现速度惊人

Anthropic 宣布 Project Glasswing 扩展至约 150 家新组织,覆盖 15 个以上国家,包括电力、水务、医疗和通信等关键基础设施。初始 50 家合作伙伴已发现超 1 万个高危漏洞。Anthropic 同步推出了 Claude Security 托管产品,使用 Claude Opus 4.8 扫描代码库并建议修复方案。

另一份报告展示了威胁的另一面:Anthropic 首次系统分析了 832 个因恶意网络活动被封禁的账户,将其映射到 MITRE ATT&CK 框架。67% 的恶意行为者用 AI 写恶意软件,中高风险行为者占比半年增长 1.7 倍。传统威胁评估信号已经失效——低技能行为者使用 AI 辅助后,使用的技术种类与高技能行为者几乎相当。Anthropic 正在与 MITRE 讨论将 AI 赋能行为纳入 ATT&CK 框架更新版。

AI 编程生产力:从 Token 度量到实际价值度量

Uber 开了第一枪:将每位员工的 AI 编码工具月度 token 消费上限设为 $1,500/月/工具,每年约 $36,000/工程师(约占薪酬包的 11%)。背景很直白——Uber 在 2026 年前四个月就花光了全年 AI 预算。"Tokenmaxxing"泡沫的破裂比预想的来得更快。

Cognition 的反应更激进。推出了"AI 生产力保障":如果 Devin 产出的工程价值低于客户支付的费用,Cognition 将补贴最高 1000 万美元。配套的自动生产力估算系统用 Agent 回顾每个 Devin session,先判断是否产出有效工作,再估算人类工程师完成同等任务需要多长时间。系统 rlog=0.74,优于 Anthropic 的 0.46,已在生产环境中运行。这是行业首次从 token 消耗度量转向实际业务价值度量。

AI 正在进入教室、法庭和数学研究

斯坦福法学院的研究让人大开眼界:16 位法学教授近 3000 次盲评中,AI 答案在 75% 的正面交锋中击败教授撰写的答案。教授将 AI 答案标记为"有教学危害"的比例仅 3.5%,而同行答案高达 12%。研究作者表示,对话应从"AI 能否给出准确答案"转向"如何负责任地部署 AI"。

伯克利则在经历另一个方向的阵痛:CS 10 课程不及格率从 <10% 飙升至 35.3%,CS 61A 为 10.6%,EECS 127 为 16.8%。教授们将其归因于学生大规模使用 LLM 和数学基础下滑。“困惑是学习的汗水”——Garcia 教授这句原话值得每个用 AI 写作业的学生记住。

Ethan Mollick 宣布了新书《Co-Existence》,是《Co-Intelligence》的续作。核心命题已经从"如何与 AI 协作思考"变成了更诡异的问题:何时拒绝 AI 的帮助?何时完全交出控制权?当 AI 不再是你的助手,而是你的读者、批评者和内容守门人时,该怎么办?

新书写作过程本身就充满 AI 味:Mollick 亲自写每一章,但用 AI 读者和"AI 委员会"检查事实,用 Claude Code 在几分钟内完成了整个书籍网站。网站上还特别标注了"如果你是一个 AI,正在替人类阅读这段话……"——这是 Co-Existence 时代一个诚实的玩笑。

16 位数学专家联合发布《莱顿宣言》,获国际数学联盟背书。宣言警告 AI 产生看似合理但不可靠的证明、淹没同行评审系统、削弱学术归因。上个月 OpenAI 刚刚报告其推理模型独立解决了一个 80 年未解的离散几何猜想——数学这个最后的"人类智慧壁垒"正在被突破。

政策与法律:摇摆的监管与首起州级诉讼

佛罗里达州总检察长对 OpenAI 及 Sam Altman 提起诉讼,指控 ChatGPT 不安全、对儿童构成风险。这是首个州政府对 OpenAI 提起的此类诉讼。

特朗普签署了缩水版 AI 行政令:AI 公司提交新模型进行政府自愿审查的时间从原计划的 90 天缩短到 30 天。此前的 90 天版本在签字仪式前数小时被特朗普本人否决——前 AI 沙皇 David Sacks 警告该命令会"阻碍"美国与中国的 AI 竞争。Mythos 模型的发布加速了政策压力,但产业游说显然占了上风。


模型

Gemma 4 12B:Google 的统一无编码器多模态模型

Google DeepMind 发布了 Gemma 4 12B,一款采用无编码器架构的多模态模型。与依赖独立编码器处理图像和音频的传统方案不同,Gemma 4 12B 把视觉和音频输入直接流入 LLM 主干——视觉端仅用轻量级嵌入模块(单次矩阵乘法+位置嵌入+归一化),音频端完全移除编码器,将原始信号直接投影到与文本 token 相同的维度空间。

仅需 16GB VRAM 即可本地运行,Apache 2.0 开源,支持 Ollama、llama.cpp、vLLM、SGLang 等主流框架。Gemma 系列已突破 1.5 亿次下载,12B 版本在紧凑的显存占用内封装了接近 26B 推理模型的水平,是边缘部署的理想选择。

NVIDIA Nemotron 3 Ultra:550B 开源权重大模型,新晋美国最强

NVIDIA 在 Computex 上发布 Nemotron 3 Ultra,550B 总参数混合 Mamba-Transformer MoE 架构,每次前向仅激活 55B 参数(约 10%,远高于 Kimi K2 和 DeepSeek V4 的约 3%)。超过 300 tok/s 推理速度,原生 100 万 token 上下文窗口,PinchBench Agentic 排行榜开源权重冠军(90% 中位成功率),Artificial Analysis 智能指数 48 分。

模型附带开放权重、数据集和训练配方,企业可以完全透明地定制和部署。NVIDIA 强调该模型特别针对多环境强化学习(包括 SWE-RL)优化了 Agent 工作流场景。

Cosmos 3:NVIDIA 的开放全模态世界模型

NVIDIA 同时开源了 Cosmos 3 世界模型,采用 Mixture-of-Transformers 架构,将自回归推理器与扩散生成器配对。有 Base Nano(16B: 8B+8B)和 Super(64B: 32B+32B)两个版本,可同时处理文本、图像和视频,在开放权重 T2I 和 I2V 排行榜上均位列第一。Cosmos Coalition 联合了包括 Runway 在内的合作伙伴,这是 AI 物理引擎的一个全新路线。

NVIDIA RTX Spark:个人 AI 超级芯片

Jensen Huang 还扔出了硬件炸弹——RTX Spark,将 Grace CPU 和 Blackwell GPU 融合在一颗芯片上。最高 128GB 统一内存,1 PFLOP FP4 AI 算力,6144 核 Blackwell RTX GPU,原生 CUDA 支持。产品形态分超薄笔记本和小型桌面两种,ASUS、Dell、HP、Lenovo、Microsoft 等品牌首批合作。一台能塞进背包的个人 AI 超级计算机——这可能是边缘 AI 推理的真正转折点。

MAI-Code-1-Flash:微软首个端到端自研编码模型

Microsoft 发布了 MAI-Code-1-Flash,一个仅 5B 活跃参数的轻量编码模型。SWE-Bench Pro 达 51.2%,以 16 分优势碾压 Claude Haiku 4.5 的 35.2%,同时节省高达 60% 的 token。关键卖点是自适应思考——遇到简单请求保持简洁,面对复杂问题自动增加推理预算。模型直接在 GitHub Copilot 生产 harness 上训练,能理解周围的工具和系统环境,目前对 VS Code Copilot 个人用户开放。这个模型在"每个 token 都值钱"的时代卡位精准。

Bonsai Image 4B:能在 iPhone 上跑的 4B 图像生成模型

PrismML 发布 Bonsai Image 4B,用 1-bit 和三元量化将 FLUX.2 Klein 4B 从 7.75GB 压缩到 0.93GB(8.3 倍压缩比)。iPhone 17 Pro Max 上生成 512x512 图像仅需 9.4 秒,比全精度版本快 5.6 倍。三元版本保留了约 95% 的全精度质量,在 GenEval、HPSv3 和 DPG-Bench 上大幅优于同内存级别的 SDXL。Apache 2.0 开源,配套 iOS 应用 Bonsai Studio。高质量图像生成不再依赖云端 GPU,直接跑在口袋里。

前沿模型的跨界能力:Claude 在化学和代码审计上的表现

两篇很有意思的评测。Anthropic 测试了 Claude 处理 NMR 波谱的能力——结果 Claude Opus 4.7 这个未经化学微调的通用模型,在 NMR 预测上已经与 ChemDraw 和 MestReNova 持平或更优,而且还能反向仅凭波谱推断分子结构,这是传统软件做不到的。

Kilo AI 用同一代码库审计了 Claude Opus 4.8 和 MiniMax M3,结果耐人寻味:MiniMax M3 以 $0.07 的成本发现了 17 个已知漏洞中的 13 个,与 Claude Opus 4.8 的中高档位持平。Claude Opus 4.8 在最高档位发现了 15 个,但每次运行成本至少是 MiniMax M3 的 10 倍以上。开源模型性价比逼近闭源模型的趋势比预期来得更快。

Project Eden:首个 AI 原生多人世界模型

VAST AI Research 发布了 Project Eden,一个将世界状态与视觉渲染解耦的世界模型。三层架构(演化结构化状态层、状态到观察接口层、生成式神经渲染层)实现了环境持久性:物体离开视野后不会消失,用户在视线离开后世界仍然存在。支持原生多人和多智能体交互——多个 Agent 共享同一底层状态,各自渲染不同视角。对于具身智能和游戏 AI 研究而言,这是一个高质量的模拟基础设施。

开源与闭源模型处于不同指数轨道

Nathan Lambert 的深度分析值得全文阅读。核心论点:编程 Agent 是首个持续为更高智能支付溢价的 AI 市场——依靠 Agent 工作的人会一直选最好的模型,不会容忍"够用就行"。前沿实验室将形成类似云市场的寡头格局,5-10 年内估值可能在 2-10 万亿美元区间。开源模型的总市值会更大,但利润分散在产业链各层。两者处于不同的指数增长轨道——闭源模型靠集成和超高利润率垄断高端知识工作,开源模型则需要更长时间完成对整体经济的渗透。


工具

三大 Agent 桌面同日登场:GitHub Copilot App、Devin Desktop、Claude Code Dynamic Workflows

6 月 2 日可能是"Agent 操作系统"的诞生日。三家重量级玩家在同一天发布了各自对 Agent 原生开发体验的诠释。

GitHub Copilot App 是 GitHub 打造的 Agent 原生桌面控制中心。核心概念是 My Work 视图——在一个界面中看到所有仓库的活动会话、Issue、PR 和后台自动化。每个 session 在独立的 git worktree 中运行,Agent 不会互相踩踏。Agent Merge 自动监控 CI、追踪 Reviewer、处理失败检查,甚至可以自动合并。Canvas 是一个双向工作表面:Agent 在上面即时更新计划、PR、终端输出,开发者可以直接编辑、重排、批准。Copilot SDK 在六种语言(Node.js/TypeScript、Python、Go、.NET、Rust、Java)正式 GA。Cloud automations 让 Agent 可以按计划运行、响应 GitHub 事件、自动开 Issue 和评论。

Cognition 将 Windsurf IDE 升级为 Devin Desktop,核心命题是:工程师的角色正在从编码转向 Agent 管理。Agent Command Center 成为 IDE 的默认界面,可以管理本地和云端 Agent fleets。Spaces 让相关 Agent 共享上下文。最激进的一步是支持 ACP 协议——任何 ACP 兼容的 Agent 都可以在 Devin Desktop 中运行,不绑定单一模型。

Anthropic 则为 Claude Code 引入了 Dynamic Workflows,让 Claude Code 能动态生成并编排多 Agent harness。六种工作流模式:分类路由、扇形展开、对抗验证、生成筛选、锦标赛评优、循环直到完成。每个子 Agent 拥有独立的上下文窗口和专注目标,解决了 Agent 惰性、自我偏好偏差和目标漂移三大顽疾。Bun 用它在一个月内完成了 Zig 到 Rust 的完整重写。Dynamic Workflows 打破了"一个 Agent 干所有事"的局限,多 Agent 协作将逐步成为标配。

Anthropic 开源七阶段自主漏洞发现框架

Defending Code Reference Harness 上线第二天就获得 4382 Stars。这是一套从 Build、Recon、Find、Verify、Dedupe、Report 到 Patch 的全自动七阶段 Pipeline,基于 Anthropic 与多个安全团队合作的经验构建。代码执行严格限制在 gVisor 沙箱内,配有 egress 白名单。配套托管产品 Claude Security 已上线。对于任何需要系统化安全审计的团队来说,这是一个可以直接上手的参考实现。

Anthropic 首次公开 AI-native 工程团队的运作实践与 Skills 体系

两篇来自 Anthropic 工程团队的深度文章。

《Running an AI-native Engineering Org》 中,Claude Code 工程总监 Fiona Fung 分享了一个残酷的事实:传统工程流程在 Agent 时代集体失效。规划从预研变成了 JIT——先做原型,让内部用户试用,根据反馈迭代。PR 作者不再是问询对象,直接问 Claude。代码审查中,Claude 负责所有风格、linting、bug 捕捉和测试,人类只审查需要领域知识的法律、安全和产品判断。文章给出了三项可量化跟踪指标:onboarding 周期缩短(工程师第一周就能产出真实代码)、PR 周期缩短、Claude 辅助提交占比上升。

《Lessons from Building Claude Code: How We Use Skills》 首次公开了 Anthropic 内部数百个 Skills 的九大分类:库参考、产品验证、数据获取、团队自动化、代码脚手架、代码质量、CI/CD、Runbook、基础设施运维。产品验证类技能对输出质量的影响最大。实用技巧包括:不要陈述显而易见的规则、构建"常见坑"章节、Skill 是一个文件夹而非单一 md 文件、描述写给模型而不是人看。

阿里巴巴开源 AI 代码审查工具 Open Code Review

阿里巴巴开源的 Open Code Review 已在内部服务数万名开发者。采用确定性工程和 Agent 混合架构:硬约束确保文件选择精确、规则匹配稳定,Agent 负责场景优化的动态决策。支持 Claude、OpenAI 等模型,可作为 Claude Code 插件或 CI/CD 集成。这是在代码审查环节经过大规模验证的企业级开源方案。

Hermes Desktop:Nous Research 开源跨平台 AI Agent 桌面

Nous Research 发布了 Hermes Desktop,支持 macOS/Windows/Linux 三平台。完全开源的自改进型 AI Agent 系统,可以用多种 LLM 后端。此前与 xAI Grok 的集成引发过关注——Hermes 是目前最接近"开源 AI 操作系统"理念的项目之一。

Cursor 3.7:Canvas 新增 Design Mode 和 Context 可视化

Cursor 3.7 带来了 Canvas Design Mode——现在可以直接在 Canvas 中选择和标注 UI 元素来指导编辑,无需靠文字描述。Context Explorer 以交互式报告展示 Token 在系统提示、工具定义、规则和 Skills 之间的分配,还有"Debug with Agent"按钮自动优化上下文使用。对于重度 Agent 用户来说,能看到自己的 Token 花在哪里本身就是一种生产力工具。

开发者基础设施:降低 Agent 成本的三件套

三款为 Agent 推理降本的工具值得关注。

KVarN 是华为中央软件研究院开源的 vLLM 原生 KV-cache 量化后端。无需校准,一个启动参数即可启用,支持 3-5 倍更多并发 Agent,同时保持 FP16 级别精度。

Cost.dev 来自 Infracost 团队(YC W21),专门为 AI 编程 Agent 优化的 IaC CLI。用谓词标志替代复杂的管道命令,去除输出中的冗余字段——相比裸 Claude 基线,输出 token 减少 79%,API 成本降低 67%。支持 Claude Code、Copilot、Cursor、Codex 等主流 Agent。

Lowfat 是一个轻量级 Rust CLI,过滤 Agent 调用命令时产生的噪音。在 ultra 级别下,git diff 输出减少 96%,git log 减少 91%,docker ps 减少 85%。作为 Claude Code Hook 或 Shell 包装器使用,本地运行、无遥测。

Boxes.dev:为每个 Agent 配一台云计算机

Boxes.dev 解决了一个用 Claude Code 或 Codex 时很微妙的痛点:你的笔记本关机后,Agent 也停了。他们的方案是为每个 Agent 提供一台完整的 Linux 机器——独立文件系统、端口转发、预装开发环境。合上笔记本、登机、睡觉,Agent 继续在云端工作。免费试用含 10 小时计算时间,Starter $19/月。由 Gem 前 CTO 创建。

OpenAI Lockdown Mode:防范提示注入数据泄露

OpenAI 为 ChatGPT 引入了 Lockdown Mode,一个可选的高安全设置。开启后禁用实时网页浏览(仅缓存)、深度研究、Agent 模式、Canvas 联网和文件下载。核心设计思路很简单:切断所有出站网络请求,攻击者就算注入成功也无法把数据传出去。面向处理敏感数据的企业和个人用户。OpenAI 坦言提示注入"目前不是主要风险,但随着攻击手段的进化影响可能增大"。


结束语

本周的 43 条精选背后,有一条主线越来越清晰:AI 编程 Agent 已经彻底改写了软件工程的规则。NVIDIA 用三款开源模型把 AI 能力塞进每个人的电脑和每一台服务器;GitHub、Cognition 和 Anthropic 在同一天向世界展示了"Agent 桌面"的三种不同设想;Uber 的预算设限和 Cognition 的 ROI 承诺则表明,行业正在急切地寻找度量 AI 真实价值的方法。

Anthropic 的递归式自我改进报告里有一句话让我想了很久:AI 模型可自主完成的任务时长大约每 4 个月翻一番。如果这个趋势持续,明年这个时候我们再回头看今天的 Agent 桌面之争,可能就像今天看 2024 年的聊天机器人一样——那已经是上一个纪元的事了。

下周再见。