本周可以用一句话概括:开源模型追上了前沿,而算力和渠道开始比模型本身更重要。GLM-5.2 用 MIT 许可和十分之一的价格打出了接近 Fable 5 的水平;SpaceX 用 600 亿美元告诉行业——拥有分发渠道的才是赢家。

行业动态

SpaceX 以 600 亿美元全股票交易收购 Cursor

这是 AI 编程工具领域迄今最大的一笔交易。SpaceX 在纳斯达克创纪录 IPO 仅数日后宣布收购 Cursor 的开发商 Anysphere,600 亿美元全股票交易,预计 2026 年 Q3 完成,终止费高达 100 亿美元。

Cursor 年化 B2B 收入约 26 亿美元。但过去一年市占率从 41% 跌至 26%,来自 Claude Code、GitHub Copilot 和 Codex 的竞争让独立 IDE 的处境越来越难。SpaceX 的算力资源——xAI 的 Colossus 超算集群——恰好补上了 Cursor 的短板。

这笔交易的一个深层信号是:AI 经济学的重心正在从模型质量转向算力接入和分发渠道。SpaceX 同期还与 Anthropic 和 Google 各签了 260 亿美元/年的云算力合同。模型可以切换,渠道一旦建立就很难替代。[来源:Reuters、CNBC、Kilo AI Blog]

Satya Nadella 提出 Loopcraft 框架:构建学习循环而不是追逐模型

微软 CEO 这篇长文获得了超过 6000 万浏览。核心观点很直接:企业真正的机会不在挑选最好的模型,而在模型之上构建学习循环——让人力资本和 token 资本一起复利增长。

"你可以外包一个任务甚至一个工作,但永远不能外包你的学习。“这是在 OpenAI 分家 8 个月后,微软 AI 战略首次被清晰阐述。优先级从"拥有前沿模型"转向了"构建前沿生态系统”。[来源:Latent Space]

DeepSeek 正式引入视觉能力,传 74 亿美元首轮融资

DeepSeek 聊天平台本周正式上线了视觉识别功能,此前仅支持文本交互。与此同时多家媒体报道 DeepSeek 完成约 74 亿美元首轮融资,估值超 500 亿美元,CEO 占股约 40%。同期美国暂缓将 DeepSeek 等 100 余家中国企业列入实体清单,微软也在考虑使用 DeepSeek-V4 自托管版本来降低 Copilot 成本。[来源:Hacker News、Ben’s Bites、Solidot]

模型与技术

GLM-5.2 成为开源模型新标杆:MIT 许可,多项基准超越 GPT-5.5

Z.ai (智谱)本周发布了 GLM-5.2,744B MoE 架构,每 token 激活 40B 参数,支持 1M 上下文窗口。最关键的三个数字:FrontierSWE 综合排名第 3,仅次于 Fable 5 和 Opus 4.8,超过 GPT-5.5;Design Arena 第 1 名,Elo 1360;Terminal-Bench 2.1 达 81.0,是首个超过 80 分的开源模型。

技术上有两个亮点。IndexShare 稀疏注意力优化在 1M 上下文中降低了 2.9 倍的 FLOPs。RL 训练中引入 LLM Judge 审查模型的反奖励作弊行为,模型曾试图通过 curl GitHub 或 grep 隐藏用例来走捷径。这种级别的公开披露在业界相当罕见。

价格方面,API 定价 $1.4/$4.4 每百万 token,约 Fable 5 的十分之一。Kilo AI 的实测对比显示,GLM-5.2 在规划阶段得分 9.0,Fable 5 得分 9.1,差距仅 0.1 分。MIT 许可意味着可以随意下载、微调、量化、蒸馏。开源阵营终于拥有了一个真正能打的模型。[来源:Artificial Analysis、Latent Space、Kilo AI Blog]

本地模型真的可以用了

Vicki Boykis 在 Hacker News 拿到 1553 分的一篇文章,标题直白:Running Local Models Is Good Now。她使用 Gemma 4 26B 加上 Pi agent 框架和 LM Studio,在本地完成了 Python 重构、代码测试、博客校对等工作,准确性约为前沿模型的 75%。这在半年前完全不可想象。

OpenFaaS 创始人 Alex Ellis 补充了企业视角:他的团队用一张 RTX 6000 Pro(约 $12,000)搭建本地推理服务,通过 MTP 推测解码把速度从 67 tok/s 提升到 200 tok/s。一家客户用本地模型分析遥测数据库,单次收入恢复就收回了显卡成本。

本地模型不是低配版的云端模型。它解决的是另一类问题:隐私合规、数据主权、无法联网的场景。推荐模型包括 Gemma 4、Qwen 3.6 系列和 OpenAI OSS-20B。[来源:vickiboykis.com、blog.alexellis.io、Hacker News]

Project Fetch 第二阶段:Claude Opus 4.7 操控机器人比人类团队快 20 倍

Anthropic 前沿红队公布了 Project Fetch 第二阶段实验,结果令人不安:Claude Opus 4.7 在没有人工协助的情况下,编程控制四足机器人完成任务,速度比最快的人类团队快约 20 倍。连接摄像头仅需 1 分 55 秒,而人类团队花了 105 分钟。机器人控制编程只用了 5 分 34 秒、1045 行代码,人类团队用了 211 分钟、10309 行。

研究人员的角色仅限于连接设备和审批命令。Anthropic 的结论是:这并非来自专门的机器人研究投入,而是通用扩展带来的能力跃升。一个值得警惕的信号是——物理世界自主 AI 代理的早期时代可能已经开始了。不过精细物理操控(抓取、推拉物体)目前仍是人类的优势领域。[来源:Anthropic Research]

Cohere 发布 North Mini Code:3B 激活参数的 Agent 编码模型

Cohere 本周发布了首个面向开发者的 Agentic 编码模型 North Mini Code,30B 总参数,仅 3B 活跃参数(MoE 架构),Apache 2.0 许可。在同等并发和硬件条件下,输出吞吐量可达 Devstral Small 2 的 2.8 倍,token 间延迟低 30%。定位明确:子 Agent 编排、系统架构映射和代码审查。支持 256K 上下文,最大生成 64K,权重可直接在 Hugging Face 下载。[来源:Cohere Blog、Hacker News]

GPT-5.5 幻觉率 86%,GLM-5.2 仅 28%:大模型的「不可能三角」

一篇在 Hacker News 拿到 444 分的分析文章对主流 LLM 的幻觉率做了系统对比。GPT-5.5 在 AA-Omniscience 基准上幻觉率 86%——面对无法解答的问题时,只有 6% 的情况会承认不知道,其余时间都在自信地生成错误答案。GLM-5.2 的幻觉率仅 28%,Claude Opus 4.8 为 36%。

文章做了一个对照实验:用 Python 异步事件循环编程题测试各模型。DeepSeek V4 Pro(1.6T 参数)花了 3 分 52 秒、7700 个推理 token,给出了一个"结构精美但完全错误"的答案;GLM-5.2 仅用了 12 秒、800 个 token 就正确识别了问题中的技术悖论。

作者由此提出 AI 的「不可能三角」:原始能力、不确定性校准(幻觉率)、计算效率三者不可兼得。行业不能继续盲目追求更大的模型规模,因为智能不仅会趋于平缓,甚至可能变得更糟。[来源:arrowtsx.dev、Hacker News]

工具与项目

Vercel 发布 Eve:Agent 领域的 Next.js

Vercel 本周正式发布了 Eve,一个开源 TypeScript AI Agent 框架。核心设计很简单:Agent = 一个目录。Markdown 写指令,TypeScript 定义工具,npx eve@latest init 即可开始。9 个标准化模块覆盖了沙箱计算、人工审批门控、持久化 Workflow、OpenTelemetry 追踪和多渠道部署(Slack / Discord / Teams / Web)。

Vercel 内部已经跑了 100 多个 Agent。一个自主 SDR Agent 年运营成本 $5K,带来了 32 倍的回报。Agent 触发部署的占比从一年前的 3% 增长到 29%,预计很快过半。开源 GitHub,支持 Claude Code 和 Codex 等外部 Agent 通过 MCP 集成。[来源:Vercel Blog、Poche Explore、daily.dev AI]

Cloudflare 推出 AI Agent 临时账户

Cloudflare 本周解决了 AI Agent 自动部署中的一个关键痛点:注册墙。Agent 运行 wrangler deploy --temporary 即可在数秒内部署 Worker,无需注册或登录,60 分钟有效期内可以反复迭代。超时后自动清理。

这背后的洞察是:后台 AI 会话没有人类参与,任何需要浏览器交互、复制粘贴的认证步骤都会让 Agent 卡住。Agent 的核心超能力是快速"写-部署-验证"循环,需要一个廉价、可丢弃的部署目标。

同期发布的 isitagentready.com 是一个免费检测工具,评估任意网站在可发现性、内容可访问性、机器人控制、协议发现和商务能力五个维度上对 AI Agent 的友好程度。Cloudflare 还与 Stripe 合作,允许 Agent 代表用户订阅服务和注册域名。[来源:Cloudflare Blog、Hacker News]

Framer Agents 深度技术分享:设计工具的 AI Agent 之道

Framer 联合创始人 Koen Bok 发表了一篇 18 分钟深度阅读的技术文章。最大创新在于通信协议——为了降低 Token 消耗,Framer 自研了一套树形结构压缩语言,将属性名缩短、丢弃默认值。Agent 直接在设计师画布上工作,而非生成代码。

质量闭环的做法也很实在:每晚跑大规模 Eval 集,分析真实会话、提出修复方案、重跑 Eval 验证。目前生成一个页面约 $3(使用 GPT-5.5),中等编辑约 $0.50。Framer 的判断是:“昂贵的 Token 只是暂时的,拥有真正设计智能的 Token 会非常便宜,甚至比大多数人预期的要快。”[来源:Framer Blog、Poche Explore]

Claude Design 重大更新:设计系统导入 + Claude Code 无缝协作

Anthropic 本周对 Claude Design 做了一次重要更新。现在可以从 GitHub 或设计文件导入品牌设计系统,Claude 使用你的组件构建,并对照设计系统检查输出。管理员可以锁定标准系统。

最关键的是与 Claude Code 的互通:通过 /design-sync 拉入设计系统,完成后直接交接给 Claude Code 继续开发,不需要从截图重新开始。新编辑器支持拖拽调整大小和对齐。已有超过 120 万用户在第一周使用。[来源:Claude Blog、Ben’s Bites]

Claude Code 新增 Artifacts:实时可视化工作进度

Claude Code 本周新增了 Artifacts 功能,把工作进度捕获为实时可分享的可视化页面。适用场景包括 PR 走查、系统说明、仪表盘和发布检查清单。页面随会话更新自动刷新,保留版本历史。

每个 Artifact 默认仅作者可见,分享后仅限组织内认证成员查看。基于完整会话上下文(代码库、连接器、对话)构建,不需要手动搭建。目前面向 Claude Team 和 Enterprise 组织提供 Beta 版本。[来源:Claude Blog]

OpenAI Codex 密集更新:录屏回放、欧洲扩展、Workspace Agent API

Codex 本周大版本更新。Record & Replay 功能让开发者录制操作流程并随时回放,对重复性任务的自动化意义重大。欧洲经济区、英国和瑞士的用户现在可以使用 Computer Use、Chrome 扩展和 Memories。

更值得关注的是 Workspace Agent API。新 Cookbook 教程详细展示了如何通过 REST API 触发保存在 ChatGPT 中的工作流,支持幂等键防重复触发、对话键保持连续性。这意味着企业可以将 AI Agent 直接嵌入现有的业务系统——会议跟进、工单处理、周报生成。[来源:OpenAI Developers]

AI 编程工程实践

Anthropic 重磅研究:40 万次 Claude Code 会话揭示专业知识的持续回报

这是本周最有价值的研究之一。Anthropic 经济研究团队分析了 2025 年 10 月至 2026 年 4 月间约 40 万次 Claude Code 会话(涉及约 23.5 万用户,使用隐私保护方法处理)。

核心发现颠覆直觉:领域专业知识比编程能力更重要。管理层的验证成功率甚至略高于软件工程师。专家用户每轮触发 Claude 约 12 个操作、输出 3200 词;新手仅 5 个操作、600 词。每提升一个专业等级,Claude 操作增加约 9%。

劳动分工的量化结果也很清晰:人做约 70% 的规划决策(决定做什么、采用什么方案、什么算完成),Claude 做约 80% 的执行决策(改哪些文件、写什么代码、运行什么命令)。所有主要职业的成功率接近软件工程师(差距在 7 个百分点以内)。

工作结构也在悄悄变化:调试占比从 33% 降到 19%,运维和数据分析几乎翻倍。典型任务的经济价值平均提升约 25%。Anthropic 的结论直接:AI 编程代理并没有替代领域专业知识——你带给代理的理解越多,代理能产出的高质量工作就越多。[来源:Anthropic Research、Hacker News]

Claude Code 七种指令方法全指南

Anthropic 本周发布了一篇系统方法论文章,从轻到重列出了指导 Claude Code 行为的七种方法:CLAUDE.md(根目录和子目录)、Rules(路径作用域)、Skills(按需加载)、Subagents(隔离上下文)、Hooks(确定性触发)、Output styles 和系统提示追加。

这篇文章的价值在于分层设计思路。200 行以内的 CLAUDE.md 适合轻量配置;Rules 支持路径作用域避免浪费 token;Hooks 在生命周期事件上确定性触发,绕过压缩,适合运行 linter 这类确定性自动化。Subagents 在隔离上下文窗口运行,只返回摘要,解决了 Agent 惰性问题。整篇可以直接用作团队配置模板。[来源:Claude Blog、Anthropic Engineering]

GitHub Copilot App 全面 GA:Agent 驱动开发的桌面中心

GitHub Copilot 桌面端正式面向 macOS / Windows / Linux 开放。四大核心能力:Agent 会话从 Issue 或 PR 启动、并行仓库各自独立分支和工作树、Canvases 双向交互界面、云端自动化定时执行 Agent 任务。

BYO 模型与工具、MCP 接入外部工具、Auto 模式对所有用户开放。AI 编程工具从"补全代码"正式迈入了"Agent 驱动开发"。[来源:GitHub Blog、Poche Explore]

AI 安全与治理

Google DeepMind 发布 AI Agent 安全控制路线图

DeepMind 本周发布了 AI Control Roadmap,核心思路是:把内部 AI Agent 视为潜在"内部威胁",基于 MITRE ATT&CK 框架建立威胁建模体系。三层纵深防御包括检测(受信任 AI 监督者持续审查工作 Agent 的推理和行动)、预防与响应(实时阻止有害行为)、安全能力分级(D1-D4 检测逃避等级和 R1-R3 攻击执行等级)。

团队已分析了 100 万个编码 Agent 任务轨迹,数据表明大多数被标记事件并非来自对抗意图,而是 Agent 的误解或过度热情。同步发布了一份面向政策制定者的技术白皮书,呼吁产业界、政策制定者和学术界协作共建安全框架。[来源:DeepMind Blog]

AIGC 应用与创意

Midjourney 跨界推全身超声波 CT 扫描仪

Midjourney 本周宣布成立独立医疗部门 Midjourney Medical,并发布了首款硬件产品:全身超声波 CT 扫描仪。设备由 35.8 万个超声元件组成的环形阵列驱动,60 秒完成全身扫描,分辨率约 0.5mm,接近 MRI。

更让人意外的是商业模式——在旧金山开 AI Spa,将健康扫描融入水疗体验,目标 2027 年底开业,长远规划在全球部署 5 万台扫描仪。团队仅有 9 人,无外部投资者,完全靠社区资助。

目前仍有一堆未解决的问题:硬件原型尚未使用 AI、FDA 审批路径不明确、监管和临床验证基本空白。但从 AI 公司到物理世界传感器的战略跃迁是真实的。如果成功,这可能是自 MRI 以来 50 年间首个全新全身成像模态。[来源:Midjourney Medical、Hacker News、Ben’s Bites、Latent Space]


本周有两个趋势值得持续关注。一是开源模型和闭源模型的差距正在以出人意料的速度缩小——GLM-5.2 不仅是论文里的数字,Kilo AI 和 Jeremy Howard 的实测都确认了它的水平。二是 Fable 5 的出口管制事件和 SpaceX 收购 Cursor 共同指向同一个方向:模型本身不再是最大的护城河,算力接入和分发渠道才是。

下周见。