Agili 的 AIGC 周刊(Y26W20)
这周只有一个关键词:加速。Karpathy 跳槽象厂、OpenAI 启动上市程序、Google I/O 一口气发了十几个 AI 产品——任何一条都是年度级别的事件,全挤在了同一周。
Karpathy 入局,Anthropic 三连击
本周最大的个人新闻毫无疑问是 Andrej Karpathy 宣布加入 Anthropic 的预训练团队。前 Tesla AI 总监、OpenAI 创始成员,如今在 LLM 进入"关键形成期"时重返一线。新东家在 HN 上相关帖子拿了 1417 分和 610 条评论,讨论的热闹程度说明了一切。
Anthropic 这周的动作不止于此。
Project Glasswing 发布了首月进展报告:与约 50 家合作伙伴使用 Claude Mythos Preview 在关键开源软件中发现超过一万个高严重性漏洞。Cloudflare 找到 2000 个(其中 400 个高危/严重级),Mozilla 在 Firefox 150 中修复了 271 个,UK AI Security Institute 称 Mythos Preview 是首个在其网络攻防模拟中完成端到端破解的模型。但报告指出了一个微妙的转折——瓶颈已从"发现漏洞"转向"验证和修补漏洞"。AI 发现洞的速度超过了人类修补的速度。
另外,Anthropic 以超过 3 亿美元收购了 SDK 平台 Stainless。Stainless 自 Anthropic API 早期就为其生成 TypeScript、Python、Go、Java 等官方 SDK。Anthropic 的逻辑很直白:AI 前沿正从"回答问题的模型"转向"能够行动的 Agent",Agent 的能力取决于它能连接多少系统。
第三件事是基础设施层面的。联合创始人 Tom Brown 宣布 Anthropic 将扩展与 SpaceX 的合作,在 Colossus 2 部署 GB200 算力。SpaceX IPO 文件同时披露了一个惊人的数字:Anthropic 每月向 SpaceX 支付 12.5 亿美元算力费,预计 Q2 营收 109 亿美元并首次实现运营利润,估值可能超越 OpenAI。
Google I/O 2026:Agent 是唯一主题
Google I/O 2026 的核心主题被 Every.to 概括得很精准——“Agents, Agents, Agents”。
Gemini 3.5 Flash 是这次的头号产品。在 Terminal-Bench 2.1(76.2%)、MCP Atlas(83.6%)等 Agent 编码基准测试中超越自家 3.1 Pro,输出速度比其他前沿模型快 4 倍。Sundar Pichai 的原话指向了一个正在蔓延的行业焦虑:不少企业已经烧光了年度 Token 预算。"Tokenmaxxing"成了硅谷热词,3.5 Flash 被定位为反思潮中的解药——可将 80% 工作负载的成本削减 10 亿美元以上。
Gemini Omni Flash 则是 Google 首个全模态视频生成模型,支持从图像、音频、视频、文本任意输入生成视频,还能通过自然语言进行对话式视频编辑和角色一致性保持。所有生成视频都嵌入了 SynthID 水印。
在科学侧,基于 Gemini 构建的多智能体系统 Co-Scientist 正式亮相并发表于 Nature。它通过"创意锦标赛"机制并行探索数千个研究方向,已在肝纤维化、ALS 等多个生命科学领域取得实验室验证成果。
OpenAI:从数学突破到 IPO
OpenAI 的通用推理模型自主解决了存在近 80 年的 Erdős 猜想,推翻了离散几何领域的核心猜想。菲尔兹奖得主 Tim Gowers 称之为"AI 数学的里程碑",证明已达到《数学年鉴》的发表标准。这是 AI 首次自主解决一个子领域的核心未解决问题。
更影响行业格局的消息来自华尔街。OpenAI 正与 Goldman Sachs 和 Morgan Stanley 合作,准备秘密提交 IPO 招股说明书,最早可能在 9 月上市。此前 陪审团一致裁定 Elon Musk 对 Sam Altman 和 Greg Brockman 的诉讼败诉,认定起诉超过三年法定时效。这为 IPO 扫清了最后一个重大法律障碍。
开源阵营的价格战也在继续。DeepSeek V4 Pro 宣布 API 价格折扣永久化,输入(缓存命中)$0.003625/M tokens、输出 $0.87/M tokens,成本仅为 GPT-5.5 的十二分之一。
AI 编程:工具军备竞赛白热化
编程工具这周的更新密度不亚于大模型发布。
Cursor 发布自研模型 Composer 2.5,基于开源 Kimi K2.5 检查点训练,在长周期任务处理能力上显著提升。更值得关注的是 Cursor 同时宣布与 SpaceXAI 合作,正在 Colossus 2 集群上从零训练一个规模为当前 10 倍的模型。目前超过 70% 财富 500 强企业使用 Cursor。
OpenAI Codex 迎来多项重大更新:Appshots(双击 Command 截取前台应用窗口发送给 Codex)、Goal Mode 正式 GA(可让 Codex 持续数小时自主推进目标)、远程 Mac 控制(锁定后仍可使用桌面应用)、插件共享市场。Codex 正在从代码助手向全桌面 Agent 演化。
GitHub Copilot CLI 远程控制正式 GA,支持在网页端和手机上监控 AI 代理会话,后续又支持气隙环境 BYOK,在完全离线的网络中也能使用 Copilot Chat。
Devin 新增了 Windows 虚拟机支持,首次大规模进入 Windows 开发生态。同步推出的 Auto-Triage 功能让 Devin 可以主动监控 Slack、Linear、GitHub、Sentry 等多渠道 Bug 报告并自动响应修复。
行业格局也在快速变化。Gartner 发布首份《企业 AI 编码 Agent 魔力象限》,GitHub Copilot 和 Cursor 同被评为领导者。Gartner 预测到 2028 年异步 AI 编码 Agent 将提升软件工程团队生产力 30%-50%。
竞争的另一面是围墙。微软正在取消大部分 Claude Code 授权,要求工程师在 6 月底前迁移至 Copilot CLI。Claude Code 在 Windows、Office、Teams、Surface 等部门"过于受欢迎",威胁到了自家工具。Fortune 的后续报道还指出了一个更根本的问题:Uber 四个月内就烧光了全年的 AI 编码预算。
xAI 在行业焦点集中在 Google I/O 时悄然推出了 Grok Build 0.1。256K 上下文窗口,无输出长度限制,定价仅 $1/M 输入和 $2/M 输出。定位为"架构师"角色,接收大型 Jira 工单自主遍历代码库完成任务。同期的 SpaceX IPO 文件披露 xAI 去年烧掉了 64 亿美元。
中国力量同样不容忽视。阿里通义千问发布 Qwen3.7-Max,在 SWE-Pro(60.6)和 Terminal Bench 2.0(69.7)上超越 Opus-4.6 Max 和 DeepSeek V4 Pro Max。35 小时完全自主内核优化完成了 1158 次工具调用,实现 10 倍加速。在 YC-Bench 创业管理模拟中收入达到 208 万美元。
工作流在变:HTML 成为 Agent 通信新语言
Claude Code 团队工程师 Thariq Shihipar 分享了一个正在蔓延的实践:在 AI Agent 输出中用 HTML 替代 Markdown。HTML 在信息密度、视觉清晰度、浏览器原生渲染和双向交互方面有压倒性优势——可以嵌入表格、CSS、SVG、交互按钮。一个令人意外的数据:99% 的 AI 生成 token 用于非生产代码(仪表盘、界面、沟通),只有 1% 最终进入代码仓库。Lenny’s Newsletter 将这一理念概括为"HTML is the new Markdown"。
在企业部署层面,Claude Managed Agents 新增自托管沙盒和 MCP 隧道,OpenAI 同步为 Codex 和 AgentKit 发布 Secure MCP Tunnel。两家公司都在解决同一个问题:如何让 Agent 安全接入企业私有网络内的数据和服务,同时不暴露公网端点。
Figma 发布了内置画布的 AI 设计代理,可自动执行重复性设计任务、并行探索设计方向。此前 Anthropic 的 Claude Design 已经在设计工具领域引发震动,Figma 的跟进让这场竞争的烈度又上了一个台阶。
开源工具方面,Forge 是一个面向自托管 LLM 的护栏框架,能把 8B 小模型在 Agent 任务上的准确率从 53% 拉到 99%。Semble 则是为 AI Agent 设计的代码搜索库,用 tree-sitter 进行代码感知分块,比 grep 节省 98% Token,支持 MCP 协议与各主流编程工具集成。
安全、溯源与基础设施
AI 安全的战役同时在两条线上推进。
一是漏洞发现。Project Glasswing 的 Mythos Preview 扫描了 1000 多个开源项目,估计发现 6202 个高危/严重漏洞,经第三方验证后真实阳性率达 90.6%。但正如前文所述,核心瓶颈已转移到修复速度。
二是内容溯源。OpenAI 宣布与 Google DeepMind 合作,在其 AI 生成图像中集成 SynthID 水印,同时通过 C2PA 标准实现内容溯源。SynthID 已累计标记超 1000 亿张图像和 6 万年的音频。NVIDIA Cosmos、Kakao、ElevenLabs 也加入支持。Google 称至今无人成功破解该水印技术。
观点:SaaS 末日、AI 乘数与人类判断
Palo Alto Networks CEO Nikesh Arora 在闭门午餐会上表达了一个激进的观点:未来一年涌入 AI 基础设施的约 1 万亿美元,将催生能动态生成 UI 的模型,导致 80% 的手工 SaaS 界面消失。他说"大多数软件本质上是一堆数据加上产品经理手工构建的 UI"——这话可能得罪半个硅谷,但逻辑上没什么毛病。
前端工程师 Josh Comeau 则提供了更接地气的视角:AI 像钢铁侠战衣而非自主机器人。Framer Motion 作者 Matt Perry 在 AI 辅助下 Q1 关闭了 160 个 issue(目标是 60 个),但 vibe-coding 社区中缺乏领域知识的人常遇到"提示 3 小时无法解决本可 30 秒手动修复的问题"。结论很清晰:对领域理解越深,AI 效果越好。这不是什么新道理,但在当下被大量"AI 替代人工"的叙事遮蔽了。
Every.to CEO Dan Shipper 在 《After Automation》 中提出了一个更有深度的悖论:公司用 AI 自动化了一切,但人类的工作却比以往更多。AI 将昨天的人类能力商品化,廉价能力大量涌现,催生出同质化的"slop",反而创造出对差异化人类判断的更高需求。他称之为"人类三明治"——人类设定框架,AI 压缩任务,人类评判和扩展结果。
AI 对就业的结构性冲击也正在发生。Intuit 宣布裁员约 3000 人(占员工总数 17%),将资源重新投入 AI 产品开发。这不是个案——亚马逊、Block、Cisco、Cloudflare、Meta、微软、Oracle 等今年均已因"向 AI 转型"裁撤数千人,而这些公司都在报告强劲营收。
Substack CEO Chris Best 确认平台正在构建 MCP 服务器,即将支持 AI 助手直接在平台上读写内容。他对此的立场挺有意思:AI 垃圾内容的问题不在 AI 本身,而在于缺乏创作意图——AI 只是放大器,而非捷径。
下期预告
下周我们将关注 Cursor 与 SpaceXAI 合作训练的更大规模模型进展,以及 OpenAI IPO 招股书是否会释放更多细节。Agent 领域的军备竞赛远未到终局。