又是充满惊喜的一周。在 AIGC 的世界里,变化总是来得猝不及防——Anthropic 一口气发布了两项重磅更新,Microsoft 证明小模型也能办大事,DeepSeek 在数学推理上取得了令人瞠目结舌的成绩。更重要的是,OpenAI 的联合创始人 Ilya Sutskever 在一次深度访谈中宣告:单纯堆算力和数据的时代已经结束,AI 研究正在回归本质。

这些变化不仅仅是技术指标的提升,更预示着整个行业正在经历一场深刻的范式转变。从聊天机器人到 Agent,从通用模型到专业工具,从云端推理到边缘计算——AI 正在以我们意想不到的方式渗透进软件开发的每一个环节。

让我们一起看看本周都有哪些值得关注的进展。


📰 资讯

Ilya Sutskever:扩展时代已结束,研究时代开启

如果说有一个声音能让整个 AI 行业集体竖起耳朵,那一定是 Ilya Sutskever。这位 OpenAI 的联合创始人、SSI 的掌舵人在最新的播客访谈中抛出了一个震撼性的观点:通过堆算力和数据的扩展时代已经结束了

他的理由很直接:预训练数据即将耗尽,继续堆算力不会带来质变。更关键的是,当前模型在泛化能力上与人类存在巨大差距。我们需要的不是更大的模型,而是能够快速学习的 AGI——它应该是一个"学习者",而不是一个全知全能的成品。

Ilya 还指出了一个有趣的问题:当前的强化学习训练可能让模型过于专注于评估基准,而忽略了真正的泛化能力。这就像是让学生只会做考试题,却不懂得如何应对真实世界的问题。

这个观点标志着 AI 研究范式的重大转变。接下来,我们将看到更多关注算法创新、架构设计和"研究品味"的工作——简洁性、优雅性,以及正确的大脑启发,将成为新的追求目标。

🔗 完整访谈


从聊天机器人到数字同事:三年进化史

还记得三年前我们第一次见到 GPT-3 时的惊讶吗?如今,AI 已经不仅仅会写诗了——它能构建交互式游戏,能处理博士级别的研究任务,甚至能从旧数据文件中恢复数据、进行统计分析,然后撰写 14 页的研究论文。

Ethan Mollick 在测试 Google 的 Gemini 3 时发现,我们正在经历一个重要的转折点:从聊天机器人时代转向数字同事时代。Google 的 Antigravity 工具已经能像 Claude Code 一样,访问你的计算机并自主编写程序。这不再是简单的问答,而是真正的协作。

这种进化带来的不仅是能力的提升,更是工作方式的根本改变。AI 不再是一个被动的工具,而是一个主动的伙伴。

🔗 阅读全文


LLM 扩展机制的演变:从 Plugins 到 Skills

如果要给 AI 工具生态画一条时间线,那会是这样的:ChatGPT Plugins (2023.3) → Custom Instructions → Custom GPTs → Memory → Cursor Rules → MCP → Agent Skills (2025.10)。

有意思的是,ChatGPT Plugins 的概念在 2023 年推出时被认为过于超前——因为当时的模型还不够强大。而如今的 Agent Skills,本质上是 ChatGPT Plugins 梦想的实现。

这个演变揭示了一个重要趋势:随着模型变得足够智能,我们正在回归使用最易访问的编程语言——自然语言。未来的 AI 扩展可能不需要复杂的 API 定义,一段清晰的描述就足够了。

🔗 了解详情


OpenAI 的新变现之路:ChatGPT 即将引入广告

ChatGPT 每周服务 8 亿用户,每天处理 25 亿次提示——这样庞大的用户基础自然会引来商业化的诱惑。最近在 ChatGPT Android 应用的 beta 版本中发现的代码证实了这一点:OpenAI 正在准备广告功能。

广告最初将仅限于搜索体验,但未来可能会扩展。考虑到 OpenAI 对用户的深度了解(可能比 Google 还要深),他们能够创建高度个性化的广告。这可能会颠覆现有的网络广告经济,但也引发了对用户隐私的担忧。

这标志着 AI 应用商业化进入了新阶段。免费时代可能正在远去。

🔗 详细报道


学术危机:21% 的 ICLR 2026 评审完全由 AI 生成

这可能是 AI 带来的最令人担忧的副作用之一。2026 年国际学习表示会议(ICLR)对 19,490 篇提交论文和 75,800 篇同行评审进行扫描后发现:约 21% 的同行评审完全由 AI 生成,超过一半包含 AI 使用的迹象。

这些 AI 生成的评审有着明显的特征:幻觉引用、冗长而模糊的反馈。更糟糕的是,提交的论文中也有 1% 完全由 AI 生成,9% 包含超过 50% 的 AI 生成文本。

这是该会议首次大规模面临这个问题,也给学术诚信敲响了警钟。如何在 AI 时代保持学术评审的质量和可信度,将成为学术界必须面对的挑战。

🔗 Nature 报道


芯片之争:TPU vs GPU,谁主沉浮?

在 AI 硬件的竞赛中,Google 一直在走一条不同的路。与英伟达的通用 GPU 不同,Google 的 TPU(Tensor Processing Unit)是专门为 AI 工作负载设计的芯片。

分析显示,在推理任务中,TPU 可能比通用 GPU 更高效,成本效益也更高。这让 Google 在长期的 AI 竞赛中占据了独特的优势——当其他公司还在为 GPU 供应发愁时,Google 已经可以用自己的芯片来支撑服务了。

这场芯片之争的结果,可能会深刻影响未来 AI 服务的成本结构和可用性。

🔗 深度分析


安全警报:Google Antigravity 的提示注入漏洞

安全研究人员发现,Google Antigravity 存在通过间接提示注入攻击窃取数据的漏洞。攻击者可以通过精心设计的提示来欺骗 AI 系统泄露敏感信息。

这个发现再次提醒我们:随着 AI 系统变得更加强大并集成到更多应用中,安全性问题变得越来越重要。间接提示注入这类攻击方式尤其难以防范,因为它们利用的是 AI 系统的"善意"和"乐于助人"。

如何在保持 AI 系统能力的同时确保其安全性,是整个行业需要认真思考的问题。

🔗 技术细节


🤖 模型

Claude Opus 4.5:新的编码之王登基

Anthropic 本周放了个大招——Claude Opus 4.5 正式发布。这不是一次小幅升级,而是一次全方位的飞跃。

在 SWE-bench Verified 测试中,Opus 4.5 成为第一个突破 80% 的模型,在编码、代理和计算机使用方面成为世界上最好的模型。更让人惊喜的是,价格降低了约 3 倍——输入 $5/百万 token,输出 $25/百万 token。

Opus 4.5 的杀手锏是它的 effort 参数,允许开发者在时间/成本和能力之间进行权衡。这意味着你可以根据任务的复杂度动态调整模型的"努力程度",既保证质量又控制成本。

在独立的编码任务对比中,Opus 4.5 以 98.7% 的平均得分和最快的执行速度(7 分钟)碾压了 GPT-5.1 和 Gemini 3.0。如果你需要产品就绪的代码,Opus 4.5 是当前的最佳选择。

🔗 官方公告


Claude 高级工具使用:Agent 技术的重大突破

如果说 Opus 4.5 是性能的飞跃,那么高级工具使用功能就是架构的革命。Anthropic 推出的三个 beta 功能彻底改变了 AI Agent 与工具交互的方式。

Tool Search Tool 让 Claude 可以按需发现工具,Token 使用从 150K+ 骤降至约 2K,减少了 85%。想象一下,给 AI 提供上千个工具的定义不再需要消耗整个上下文窗口。

Programmatic Tool Calling 允许 Claude 通过代码来编排工具,Token 使用减少 37%,准确性显著提升。这就像是给 AI 提供了一个编程环境,让它可以像开发者一样组合和使用工具。

Tool Use Examples 则通过提供示例,将复杂参数处理的准确率从 72% 提升到 90%。这证明了"show, don’t tell"的有效性——一个好的示例胜过千言万解。

这三个功能的组合使 Claude 能够像人类开发者一样动态管理和使用大量工具,这是 Agent 技术的重大突破。

🔗 技术详解


FLUX.2:专业级的视觉生成模型

Black Forest Labs 发布的 FLUX.2 为专业创意工作流程带来了生产级别的图像生成能力。

FLUX.2 最大的亮点是支持多参考图像(最多 10 张)并保持角色和风格一致性,这对于需要生成系列图像的创意工作来说是刚需。它还能编辑高达 400 万像素的图像,并可靠地处理光照、布局和徽标等细节。

FLUX.2 家族包括四个变体:pro(最高质量)、flex(可控参数)、dev(32B 开源模型)和即将推出的 klein(Apache 2.0 许可)。这种分层策略既满足了商业用户的需求,也照顾了开源社区。

🔗 了解更多


Fara-7B:小身材,大能量

Microsoft 证明了一个重要论点:小模型在专业任务上也能打

Fara-7B 是第一个专为计算机使用设计的代理小语言模型,仅有 70 亿参数,却在其规模类别中达到了最先进的性能。它通过视觉感知网页并执行操作(滚动、打字、点击),无需辅助功能树或单独的解析模型。

更令人印象深刻的是效率:Fara-7B 平均每个任务仅需约 16 步,而其他模型需要 41 步。在 WebVoyager 测试中得分 73.5%,优于同规模模型和部分更大的系统。

由于体积小,Fara-7B 可以在设备上部署,这意味着更低的延迟和更好的隐私保护。对于边缘计算和隐私敏感的场景来说,这是一个理想的选择。

🔗 GitHub 仓库 ⭐ 1.4k


DeepSeekMath-V2:数学推理的新高度

DeepSeek 在数学推理领域取得了令人瞠目结舌的成绩:IMO 2025 金牌、CMO 2024 金牌、Putnam 2024 接近满分 118/120。

DeepSeekMath-V2 的核心创新在于自我验证机制。它训练了一个准确且忠实的 LLM 验证器用于定理证明,并激励生成器在最终确定之前识别并解决证明中的问题。这种"生成-验证"的循环不断提升模型的推理能力。

更重要的是,DeepSeekMath-V2 展示了一个可行的研究方向:通过扩展验证计算来自动标注新的难以验证的证明,创造训练数据以进一步改进验证器。这种自我改进的循环可能是通向更强大数学 AI 的关键。

🔗 GitHub 仓库 ⭐ 1k


三大编码模型横向对比

11 月是编码模型的"超级月"——OpenAI、Google 和 Anthropic 都在这个月发布了他们最好的编码模型。Kilo AI 通过三个实际任务对 GPT-5.1、Gemini 3.0 和 Opus 4.5 进行了全面对比。

Claude Opus 4.5 总体得分最高(98.7%),速度最快(7 分钟),在完整性和产品就绪度上表现最佳。如果你需要快速交付高质量代码,选它没错。

GPT-5.1 的代码更加防御性,文档更完善,倾向于添加额外的验证和错误处理。如果你在构建关键系统,需要健壮性和可维护性,这是个好选择。

Gemini 3.0 的代码最精确、最小化,成本最低($1.10),严格遵守提示要求。如果你成本敏感且需要精确实现,Gemini 值得考虑。

每个模型都有其独特的"代码风格"和适用场景,选择哪个取决于你的具体需求。

🔗 详细评测


小模型 + 多 Agent:另一种可能性

并不是所有问题都需要大模型来解决。一位开发者分享了他的经验:通过让多个小型、专业化的 Agent 协同工作,可以获得比单个大型模型更好的结果。

使用 Ollama 进行推理、CrewAI 进行编排,在 Apple Silicon M1 上就能实现高效的本地 AI 工作流。小模型运行速度快、完全本地化、成本低,当它们被包装在 Agent 系统中时,整体智能水平大幅提升。

这个案例证明了小模型在边缘场景的可行性,为那些关注成本和隐私的应用提供了新思路。

🔗 实践分享


🛠️ 工具

CLAUDE.md:让 AI 真正理解你的项目

如果你在使用 Claude Code,一定要了解 CLAUDE.md 文件。这是一个放在代码库根目录的配置文件,可以为 Claude 提供项目架构、编码标准和工作流程的持久上下文。

使用 /init 命令可以自动生成初始配置,然后你可以连接自定义工具、定义标准工作流程、创建自定义命令。这让 AI 编码助手能够真正理解你的项目结构,提供更准确的帮助。

这不仅仅是一个配置文件,更是一种新的协作方式——你通过 CLAUDE.md 向 AI 传递项目的"灵魂"。

🔗 官方指南


GitHub Copilot agents.md:从 2500+ 仓库中学到的经验

GitHub 团队做了一件有意思的事:他们分析了超过 2500 个 agents.md 文件,总结出了成功的关键要素。

他们发现,大多数 agent 文件效果不佳的原因是指令模糊。好的 agents.md 应该包含 6 大核心要素:明确的角色定义、可执行的命令、代码范例、清晰的边界、详细的技术栈说明,以及对命令、测试、项目结构、代码风格、Git 工作流和边界的全面覆盖。

最有价值的洞察是:一个真实的代码片段比三段描述更有效。Show, don’t tell,永远适用。

文章还提供了完整的模板和六种常见代理(@docs-agent、@test-agent、@lint-agent 等)的构建指南,非常实用。

🔗 最佳实践


Runprompt:让 Prompt 像程序一样运行

这是一个优雅的小工具:单文件 Python 脚本,零依赖,却能让你的 prompt 像 Unix 程序一样通过管道串联起来。

Runprompt 支持 Google 的 Dotprompt 格式,可以定义输入输出 schema,支持多个提供商(Anthropic, OpenAI, Google AI, OpenRouter, Ollama)。最酷的是,你可以给 .prompt 文件加上 shebang,让它们直接可执行。

这为 prompt 工程提供了标准化的工作流程工具,让你可以像构建 Unix 管道一样构建 AI 工作流。

🔗 GitHub 仓库 ⭐ 299


ERA:AI 代码的安全沙箱

运行 AI 生成的代码总是让人有点担心——万一它删了什么重要文件呢?ERA 就是为了解决这个问题而生的。

ERA 基于 microVM 技术,提供硬件级别的隔离保护。它的启动时间仅需 200ms,有着容器般的开发体验,却具有更强的安全性。支持 Python、JavaScript/TypeScript、Go、Ruby 等多种语言。

ERA 专为 AI coding agents(如 Claude、Codex)设计,可以防御 jailbreak 攻击对主机的威胁。它提供本地 CLI 工具,也有可选的 Cloudflare Worker API,灵活性很高。

对于需要在生产环境中运行 AI 生成代码的场景,这是一个理想的安全方案。

🔗 GitHub 仓库 ⭐ 184


ChatGPT 应用开发的黄金法则

OpenAI 发布了一份关于如何构建优秀 ChatGPT 应用的实践指南,核心思想可以用三个词概括:Know(新的知识)、Do(新的行动)、Show(更好的展示)

一个好的 ChatGPT 应用不应该试图移植整个产品,而应该是一组明确定义的工具,能够执行任务、触发交互或访问数据。它应该在这三个维度中至少一个提供独特价值:提供用户无法轻易获取的信息,执行用户无法自己完成的操作,或者以更好的方式呈现信息。

这份指南帮助开发者避免一个常见陷阱:构建简单的功能复制,而不是真正有用的 AI 应用。

🔗 开发指南


Lovable:AI UI 设计的 Prompt 艺术

Lovable 的官方文档提供了一份关于如何写出更有效 Prompt 的实用指南,核心思想是:系统化构建胜过随意尝试

10 个核心技巧包括:让 AI 主动提问、提前做好规划、按组件而非整页进行提示、使用真实内容而非占位符、使用原子化的 UI 术语等。最有价值的建议是:为常用布局创建可复用的 Prompt 模式,并在设计阶段就考虑后端逻辑。

这套方法论强调从明确的计划出发,以系统化的方式构建,通过精确的指令执行,最终进行有序的迭代。这不仅适用于 UI 设计,也是所有 AI 辅助开发的黄金法则。

🔗 Prompt 指南


宝玉的两篇深度好文

国内 AI 圈的资深从业者宝玉本周翻译了两篇 Anthropic 的工程实践文章,质量都很高。

第一篇讲的是如何让 AI Agent 胜任长期任务。核心方法是使用"初始化 Agent + 编程 Agent"的双重架构,配合功能列表管理、Git 历史记录和进度日志,让每个 Agent 在新会话中都能快速了解项目状态。这解决了 Agent"贪多嚼不烂"和"盲目自信"两大问题。

第二篇从第一性原理出发深度拆解了 Claude Skill 系统。揭示了 Skills 本质上是基于提示词的"元工具"架构,通过提示词扩展和上下文修改来改变 Claude 的行为。文章详细解释了 SKILL.md 文件结构和执行流程,为理解和开发 Claude Skill 提供了深入的技术洞察。

🔗 长期任务架构 🔗 Skill 系统深度解析


写在最后

这一周的信息量有点大。从 Opus 4.5 的发布到 Ilya 的"扩展时代终结论",从小模型的逆袭到 Agent 技术的突破——每一条都足以单独成为头条。

但串联起来看,这些事件共同指向一个方向:AI 正在从"大力出奇迹"转向"巧劲见真章"。规模化不再是唯一的道路,架构创新、专业化、安全性、可解释性——这些曾经被忽视的方面正在变得越来越重要。

对于开发者来说,这是个好消息。工具变得更强大、更易用、更便宜;小模型也能办大事;边缘计算和隐私保护成为可能。AI 不再是高高在上的云端服务,而是可以真正融入日常工作流程的伙伴。

下周见!


本周刊由 Agili 精心策划,关注 AIGC 领域的最新动态。如果你觉得有价值,欢迎分享给更多朋友。