Agili 的 AIGC 周刊(Y26W21)
本周 AI 圈最大的新闻无疑是 Anthropic 以 9650 亿美元估值完成 H 轮融资,首次在估值上超越 OpenAI。但比融资数字更有趣的是同期发布的 Opus 4.8 和动态工作流。基础设施层正在密集诞生百亿估值公司,编程 Agent 的 PMF 已被确认,而「AI 疲劳」的声浪也越来越响。行业正从野蛮扩张转向理性审视。
模型与融资
Anthropic 完成 650 亿美元 H 轮融资,估值 9650 亿超越 OpenAI;同步发布 Claude Opus 4.8
Anthropic 宣布 H 轮融资 650 亿美元,投后估值 9650 亿,领投方包括 Altimeter、Dragoneer、Greenoaks 和 Sequoia,年化收入已突破 470 亿。同日发布的 Opus 4.8 将上下文窗口扩展到 100 万 token,在 SWE-Bench Pro 上达到 69.2%,比 GPT-5.5 高出 10 个百分点。新模型引入自适应思考、Effort Control,并把快速模式输出速度提升至 2.5 倍,定价与 Opus 4.7 持平。社区普遍评价为「增量改进」,但 Jeremy Howard 发现它「不那么过度 agentic,更配合」——修复了前代的懒惰问题,更像一个靠谱的合作者而非急于表现的助理。
Cognition 以 260 亿估值完成超 10 亿美元 D 轮融资,89% 代码由 Devin 提交
Cognition 宣布 D 轮融资超 10 亿美元,估值较 8 个月前增长 2.5 倍,ARR 达 4.92 亿,企业使用量年增超 10 倍。客户包括 Mercedes-Benz(将 8 个月遗留系统迁移缩短至 8 天)、Goldman Sachs、美军等。Cognition 内部 89% 的代码提交来自 Devin,同时自研的 SWE-1.6 已成为 Windsurf 中使用最多的模型。这家独立 Agent 实验室证明了「Agent-first」商业模式可以不依附于基础模型公司独立成立。
AI 推理基础设施新晋 Decacorn:Fireworks 150 亿、Baseten 110 亿、OpenRouter 1.13 亿 B 轮
AI 推理基础设施密集迈入百亿估值区间。Fireworks 以 150 亿估值完成融资(7 个月涨 3.75 倍),Baseten 估值 110 亿(3 个月涨 2.2 倍),OpenRouter 完成 1.13 亿 B 轮——周 token 用量从 5T 飙升至 25T。推理基础设施正从模型层的附属变为独立的巨大商业板块,多模型路由和推理优化已成为企业刚需。
Liquid AI 发布 LFM2.5-8B-A1B:消费级硬件上的边缘推理模型
Liquid AI 发布 8B 总参/1B 活跃的 MoE 边缘模型,128K 上下文,38T token 预训练,并首次引入大规模强化学习。模型采用非 Transformer 架构,在 M5 Max 上跑出 253 tok/s,手机上约 30 tok/s,支持 llama.cpp、MLX、vLLM 等主流框架。对于想在本机运行推理 Agent 的开发者来说,这是一块及时的基础设施拼图。
AI 编程工程
Claude Code 动态工作流:并行调度数百子 Agent,11 天完成 75 万行 Rust 重写
Claude Code 正式推出 Dynamic Workflows(内置代号 ultracode),自动拆解复杂任务、并行启动数十到数百个子 Agent 并交叉验证结果。Bun 项目已用此功能将 Zig 代码库迁移到 Rust,11 天生成约 75 万行代码,测试通过率 99.8%。这是 Agent 编排能力的一次质变:从「一个模型帮你写代码」到「一个模型指挥上百个模型并行建设系统」。功能已面向 Max、Team、Enterprise 和 API 用户开放。
Cursor 3.6 发布 Auto-review 模式:让 Agent 在更少审批下安全自主运行
Cursor 3.6 引入三层审批逻辑来解决 Agent 的「审批疲劳」:授权列表中的调用直接放行,可沙箱化的操作在隔离环境安全执行,其他操作由分类子 Agent 智能判断是否放行或请求用户审批。Faire 的客户案例显示,云端并行 Agent 将 PR 吞吐量翻倍,原本需要 18 个月的遗留系统迁移仅需 1 名工程师管理一群云 Agent 即可完成——超过 25 个自动化流程每周执行超 2000 次自主 Agent 运行。
慢即是快:用 AI 写出更高质量的代码
Nolan Lawson 在 HN 上获得 1237 分的文章提出了一套「慢速 AI 编程」方法论:使用 Claude、Codex 和 Cursor Bugbot 多 Agent 并行审查 PR,交叉验证降低幻觉率。他发现 LLM 尤其擅长发现历史遗留 Bug——经常在审查 PR 时顺带修复代码库积弊。AI 的真正价值是做代码质量的守护者,而非 10 倍速度的潦草产出。这篇文章是对「AI 等于快速堆代码」叙事的有效纠偏。
Every.to 发布 Codex 知识工作完全指南与 Compound Engineering 2.0
Katie Parrott 撰写了一份将 OpenAI Codex 从编程工具转变为知识工作 OS 的完整指南,涵盖五级使用层次和 13 个工作流模板(收件箱清零、GTM 计划、KPI 报告等)。同期 Kieran Klaassen 将 Compound Engineering 从四步升级为八步循环(Ideate → Brainstorm → Plan → Work → Review → Polish → Compound),核心洞见是:AI 能力提升后,「Work」阶段越来越无聊(代码编写和测试已自动化),人类的注意力集中在两端:决定什么值得构建,以及确保体验的「感觉」正确。用作者的话说:AI 是三明治的肉,人类是两端的面包。
安全与边界
Anthropic 发布 Claude 全产品线的容器化安全架构
Anthropic 工程团队首次系统性公开了 Claude 三款产品(claude.ai、Claude Code、Cowork)的容器化安全实践。三款产品采用了三种不同的隔离方案:gVisor 沙箱、OS 级 Seatbelt/bubblewrap、本地 VM 隔离。文章披露了多次真实安全失败案例——从代码在用户同意前被执行、员工被钓鱼后 Claude 完成 24/25 次数据外泄,到恶意文件通过已批准域名的 API 外传数据。最核心的设计原则是:「先在环境层做确定性隔离,再在模型层做概率性引导。」对任何部署 Agent 的团队来说,这是目前最具实操参考价值的公开文档。
Anthropic 发布面向企业 AI Agent 的零信任安全框架
Anthropic 发布了三级零信任框架(基础/进阶/优化),系统覆盖提示注入、工具投毒、身份滥用、记忆投毒、供应链攻击五大威胁面。八阶段实施工作流从身份认证到记忆保护层层递进,配套医疗、金融、政府等受监管行业的合规方案和可下载白皮书。框架还提出了 Agentic SOAR(安全编排、自动化和响应)概念——用 AI 加速的防御对抗 AI 加速的攻击。企业部署 Agent 的首要障碍是安全合规,这份框架是目前最系统的开源参考。
YouTube 将自动标记 AI 生成视频,DuckDuckGo 无 AI 搜索访问量增长 28%
YouTube 宣布推出自动 AI 检测系统——即使用户未手动披露,也能识别逼真的 AI 生成内容并强制打标。长视频标签显示在播放器下方,Shorts 作为叠加层展示。同期,在 Google 宣称「用户喜爱 AI 搜索模式」后,DuckDuckGo 的无 AI 搜索访问量一周内增长近 28%。AI 内容标注正从自愿走向强制,「反 AI」正在成为有效的差异化竞争力——两条趋势都在加速。
行业反思
企业 AI 支出回报危机:Uber 前四月烧光全年预算,Tokenmaxxing 泡沫破裂
Uber COO Andrew Macdonald 公开表示 AI 投入「越来越难以证明合理性」,公司前四个月就用完全年 AI 预算,但没见到消费者端功能的相应增长——「token 消耗和有用功能之间的关联还不存在」。微软取消了大部分 Claude Code 授权,有企业因未设使用上限单月花掉 5 亿美元。行业叙事正从盲目的「Tokenmaxxing」转向理性的 ROI 追问,直接冲击企业采购决策和创业公司融资故事。
教宗良十四世发布首道 AI 通谕:AI 必须服务人类而非少数强者
教宗良十四世发布 4.2 万词通谕《Magnifica Humanitas》,直接挑战科技巨头权力,呼吁「解除 AI 武装」并加强监管。通谕发布时 Anthropic 联合创始人 Chris Olah 在场,体现了梵蒂冈与 AI 安全领域的深度互动。有趣的是,部分段落被 AI 检测工具标记为 AI 撰写。全球最具影响力的道德权威首次系统性论述 AI,且硅谷最重要的 AI 安全公司联合创始人列席——象征意义和历史意义都值得关注。
「我不想再跟 AI 说话了」:1988 分的 AI 疲劳宣言
一篇个人随笔获得 HN 本周最高分(1988 分),记录了被 AI 包围的荒诞日常。GitHub 上关于恶意软件的求助收到 AI 回复,同事用 ChatGPT 截图代替回答,在 Reddit 交流数轮才发现对方是 AI。文章击中了大量读者的共同经历——AI 正在填塞我们接收到的每一个信息通道,但其中太多是「意义形状的注意力吸血鬼」,消耗脑力却不给回报。DuckDuckGo 无 AI 搜索的增长数据从另一个侧面验证了这种情绪。
Ethan Mollick:选择保持人性——在 AI 时代有意识地决定何时使用 AI
Mollick 引用多项实验数据揭示了 AI 使用的微妙分界:用 AI 代写作业的学生考试成绩更差,而用 AI 做个性化辅导的学生提高显著(相当于 6-9 个月额外学力)。他在 BCG 顾问实验中发现了「认知投降」现象——精英顾问也会盲目接受 AI 的错误答案,因为那看起来足够权威。核心观点尖锐但不过激:一旦默认使用 AI,思考和判断就会被外包。一旦一代学生和工作者养成了不思考的习惯,这些默认设置将很难逆转。
全局视角
Simon Willison:Anthropic 和 OpenAI 终于找到了 PMF——编程 Agent 才是印钞机
Willison 的分析直击 AI 商业模式的核心矛盾:ChatGPT 虽坐拥 9 亿周活用户,但付费转化率仅 5.6%;编程 Agent 每个用户每月轻松消耗数百到上千美元的 API 费用。Anthropic 预计 Q2 首次实现运营利润(收入或达 109 亿美元),SpaceX S-1 文件披露 Anthropic 每月向其支付 12.5 亿美元算力费。编程 Agent 不是 AI 的附属应用,它就是 AI 的核心收入引擎——这个判断正在被验证。
Figma Make 现已支持本地代码:设计师可在 Figma 中直接操作生产代码库
Figma Make Beta 发布了一项跨越式功能:可视化编辑本地代码库——选择元素、调整属性、AI Agent 自动更新底层代码,内置 Git 工作流(分支、提交、PR),支持基于注释的交互和动画提示。目前免费,仅支持 Mac 桌面。设计师现在可以直接在代码库上工作——设计到代码的「最后一公里」真正被打通了。
Interconnects 全局分析:开源模型仍无 Opus 4.5 级 Agent 时刻,中美 AI 差距持续扩大
Nathan Lambert 从六个维度梳理了 AI 行业的结构性趋势:开源模型距闭源 Agent 体验仍差 12 个月以上;Google 尚无 Claude Code/Codex 竞品;Mythos 级开源模型今年无望;美国开源模型(Gemma 4 等)正在回升;已有权力结构(梵蒂冈、中国、美国国防)正在加速介入 AI 管控。一个被忽视的洞察是:AI 正在将行业推向两极——最大的公司会前所未有地大,最小的公司(如 Interconnects 本身)通过 Agent 放大专业能力也能活得很好,而中间层知识工作者的可雇用性正在系统性下降。
本周的主题词是「分界」。Anthropic 和 Cognition 在证明上限可以有多高,企业客户在追问成本到底有多合理,教宗和 HN 用户在问边界应该划在哪里。下周见。