Agili 的 AIGC 周刊(Y25W46)
这一周的 AIGC 领域格外热闹。Google、Anthropic 和 OpenAI 三大巨头齐齐发布重磅模型更新,MCP 协议迎来交互式 UI 支持,Agent 开发工具持续演进。与此同时,研究者们在架构创新和系统可靠性上取得突破,而一线开发者的实践经验也为我们揭示了 AI 辅助开发的真实挑战与机遇。
资讯
🚀 三巨头同周发布重磅模型
Gemini 3 登顶多个排行榜
Google 发布的 Gemini 3 可能是本周最大的新闻。这个模型在 LMArena 排行榜上以 1501 Elo 的成绩位居榜首,在 Humanity’s Last Exam 上达到 PhD 级推理水平(37.5%),并在多个基准测试中刷新记录。特别值得关注的是,Gemini 3 提供了 100 万 token 的上下文窗口,以及全新的 Deep Think 模式——后者在 ARC-AGI-2 上达到了前所未有的 45.1%。
Google 将 Gemini 3 的能力概括为三个"任何":学习任何内容、构建任何内容、规划任何内容。在编码能力上,它在 WebDev Arena 获得 1487 Elo,SWE-bench Verified 达到 76.2%。配合 Gemini 3 的发布,Google 还推出了 Antigravity——一个对标 Cursor 的 agentic IDE,标志着 Google 正式进军 AI 辅助编码市场。
Opus 4.5 引入创新的 Effort 参数
Anthropic 的 Claude Opus 4.5 在编码领域表现尤为突出,在 SWE-bench Multilingual 的 7/8 种编程语言中领先。最有意思的创新是"Effort 参数"——开发者可以在时间/成本和能力之间做权衡。中等 effort 级别能匹配 Sonnet 4.5 的性能,但使用的输出 token 减少 76%;最高 effort 级别则超越 Sonnet 4.5 性能 4.3%,同时仍然使用少 48% 的 token。
来自 GitHub、Replit、Cursor 等公司的早期访问用户给出了积极反馈,普遍提到了"更少的 token,更好的结果"。定价也更加亲民:$5/$25 每百万 token(输入/输出),使 Opus 级别的能力更易获得。
GPT-5.1-Codex-Max 支持 24 小时超长任务
OpenAI 的 GPT-5.1-Codex-Max 带来了一个突破性特性:“压实”(compaction)机制。这是首个原生训练在多个上下文窗口中操作的模型,能够在单个任务中连贯地处理数百万 token。这解锁了项目级重构、深度调试会话和多小时代理循环。内部评估显示,模型可以处理超过 24 小时的任务。
此外,这也是第一个训练在 Windows 环境中操作的模型,在 Terminal-Bench 2.0 上得分 58.1%,SWE-Lancer IC SWE 达到 79.9%。
🤝 MCP 协议迎来交互式 UI 支持
Anthropic、OpenAI 和 MCP-UI 社区联合推出了 MCP Apps Extension (SEP-1865),为模型上下文协议引入交互式用户界面支持。这解决了社区最受欢迎的功能请求之一——让 MCP 服务器能够提供丰富的交互式 UI,而不仅仅是文本响应。
该扩展采用了多层安全设计:UI 内容在沙盒 iframe 中运行,使用预声明模板、可审计消息和用户同意机制。重要的是,它保持了向后兼容性——现有的 MCP 实现无需任何更改就能继续工作。这项工作融合了 MCP-UI 项目和 OpenAI Apps SDK 的成功经验,为整个生态系统建立了一致的标准。
🧪 研究突破:从架构创新到可靠性提升
NVIDIA TiDAR:思考与表达的混合架构
NVIDIA 发布的 TiDAR 是一个创新的序列级混合架构,在扩散模型中起草 token(“思考”),然后自回归采样最终输出(“表达”)——所有这些都在一次前向传递中完成。这种设计巧妙地结合了扩散语言模型的快速并行生成和自回归模型的高质量输出。
实验结果令人印象深刻:TiDAR 是第一个在缩小与 AR 模型质量差距的同时,实现每秒 4.71x 到 5.91x 更多 token 的架构。这意味着在保持质量的前提下,推理速度提升了 4-6 倍。
MAKER:零错误完成百万步任务
研究人员介绍的 MAKER 系统是第一个成功以零错误解决超过一百万步 LLM 任务的系统。其核心方法是"极端分解"——将任务极度分解为子任务,每个子任务由专注的微代理处理,并在每一步应用错误纠正。
这个突破的意义在于:过去模型存在持续的错误率,导致流程在最多几百步后就会脱轨。MAKER 证明了通过大规模分解代理过程(MDAPs),可以有效解决组织和社会层面的复杂问题。
对抗性诗歌揭示安全漏洞
一项研究发现,对抗性诗歌可以作为大语言模型的通用单轮越狱技术。在 25 个前沿模型的测试中,精心策划的诗歌提示产生了高攻击成功率,部分提供商超过 90%。更令人担忧的是,诗歌框架的攻击成功率比散文基线高达 18 倍。
这个发现揭示了一个深层问题:仅凭风格变化就可以绕过当代安全机制,说明当前的对齐方法和评估协议存在根本局限性。
👨💻 实践经验:Agent 开发的真实挑战
Flask 作者:Agent 设计依然困难
Flask 框架的作者 Armin Ronacher 分享了他在构建 AI Agent 过程中的新经验。几个关键观点值得注意:
- 直接使用原生 SDK(OpenAI、Anthropic)而非高级抽象,以获得更多控制权
- 显式缓存管理虽然繁琐,但提供更好的可预测性和成本控制
- 在每次工具调用后通过"强化"注入额外信息至关重要
- 将可能失败的任务放在子 Agent 中运行,避免污染主上下文
- 测试和评估仍然是最困难的问题,目前没有令人满意的解决方案
YC 初创公司的 Claude Code 实践
Claude 官方博客分享了三家 Y Combinator 初创公司使用 Claude Code 的成功案例,特别有启发的是 Vulcan Technologies——两位创始人都没有传统工程背景,却在 2025 年 4-5 月用 Claude 构建了原型并赢得政府合同,击败了老牌咨询公司。他们的 AI 驱动监管分析为弗吉尼亚人每年节省超过 10 亿美元。
几个关键的最佳实践:将研究、规划和实施分成独立的会话;审慎管理上下文;准备好监控和中断思维链。
Terence Tao:AI 辅助数学研究成为常规
著名数学家 Terence Tao 分享了 AI 辅助解决 Erdos 问题 #367 的完整过程:人类提出猜想 → Gemini Deepthink 10 分钟生成证明 → 人类半小时简化 → Aristotle 工具 2-3 小时完成 Lean 形式化 → AI 15 分钟文献检索。这个案例展示了 AI 在学术数学研究中的实际应用价值,从证明生成到形式化验证的完整工作流程已经成型。
模型
OLMo 3:完全开源的大语言模型家族
Allen Institute for AI 发布的 OLMo 3 不仅提供模型权重,还公开完整的"模型流"——包括训练数据、代码、检查点等一切。这个家族包含四个变体:
- OLMo 3-Base (7B, 32B):最强大的完全开源基础模型,支持约 65K tokens 长上下文
- OLMo 3-Think (7B, 32B):旗舰推理模型,可以追溯到训练数据
- OLMo 3-Instruct (7B):专注于聊天和快速响应
- OLMo 3-RL Zero (7B):完全开源的强化学习路径
核心理念是完整透明性、可定制和可追溯。研究者可以在任何阶段介入,调整数据、后训练或从早期检查点构建。训练数据规模惊人:Dolma 3 约 9.3 万亿 token,Dolma 3 Mix 5.9 万亿 token。
Nano Banana Pro:最先进的图像生成模型
Google DeepMind 基于 Gemini 3 Pro 构建的图像生成和编辑模型,有三大核心能力:
1. 增强推理和世界知识:可以连接 Google 搜索获取实时信息(天气、体育),创建准确的教育信息图和图表。
2. 多语言文本渲染:这是最佳的文本渲染模型,支持从短标语到长段落,多种纹理、字体和书法风格。
3. 高保真视觉创作:可以混合多达 14 张图像,保持多达 5 个人物的一致性;提供工作室级创意控制(局部编辑、相机角度、色彩分级、照明转换);支持 2K 和 4K 分辨率。
FARA-7B:首个 Agentic 小语言模型
Microsoft 发布的 FARA-7B 是首个专为计算机使用设计的 agentic 小语言模型,仅 70 亿参数就在同等规模中达到最先进性能。它可以直接在设备上运行,通过视觉感知网页并采取行动(滚动、输入、点击),不依赖额外信息。
基准测试表现领先同规模模型:WebVoyager 73.5%、Online-Mind2Web 34.1%、DeepShop 26.2%。更重要的是成本效益:在 WebVoyager 上平均只需约 16 步即可完成任务,而 UI-TARS-1.5-7B 需要约 41 步。
这代表了一个重要趋势:小型模型通过专门优化,在特定任务上可以达到甚至超越大模型的表现,同时保持本地运行的优势。
工具
Anthropic 高级工具使用功能
Anthropic 发布的三个 beta 功能让 Claude 能够动态地发现、学习和执行工具:
1. Tool Search Tool(工具搜索工具):按需发现工具,不消耗上下文窗口。在内部测试中,Opus 4 从 49% 提高到 74%,Opus 4.5 从 79.5% 提高到 88.1%。这解决了预加载所有工具定义会消耗大量 token 的问题。
2. Programmatic Tool Calling(编程式工具调用):在代码执行环境中调用工具,平均使用量从 43,588 tokens 下降到 27,297 tokens,减少 37%。只有最终输出进入上下文,避免了中间结果污染。
3. Tool Use Examples(工具使用示例):在工具定义中提供示例工具调用,将复杂参数处理的准确性从 72% 提高到 90%。
Claude Skills:模块化能力扩展系统
Claude 详细介绍了如何创建 Skills 来扩展其能力。采用三层渐进式加载:Level 1 元数据(始终加载,约 100 tokens/技能)、Level 2 指令(触发时加载,少于 5k tokens)、Level 3 资源(按需加载,实际上无限制)。
创建 Skill 的 5 个步骤:理解核心需求 → 编写名称 → 编写描述字段(决定何时激活)→ 编写主要指令 → 上传 Skill。这种设计既保证了灵活性,又有效控制了上下文消耗。
mcp-use 代码模式:节省 98.7% 上下文
mcp-use 推出的"代码模式"允许 AI 代理通过执行代码与工具交互,而非传统的直接调用。核心优势包括:
- 渐进式披露:代理按需搜索并加载工具,Token 消耗从 150,000+ 降至约 2,000
- 上下文高效:在独立环境中处理数据,仅返回最终摘要
- 强大的控制流:利用代码原生支持的循环、条件和错误处理
- 隐私保护:敏感数据不进入模型上下文
实际效果惊人:文件系统批量重命名任务,工具调用次数减少 94%,上下文 Token 消耗降低 94%,执行速度提升 17 倍。
LLM Gateway & AI Proxy:统一管理 LLM API
两个开源的 LLM API 网关在本周受到关注:
LLM Gateway 提供统一接口(OpenAI API 兼容)、多提供商路由、用量分析和性能监控。支持云端托管和自部署两种方式。
AI Proxy 则提供智能路由(基于模型优先级和错误率)、全面监控、多租户隔离和速率限制。支持 Docker 部署,可与 Sealos、FastGPT 等平台无缝集成。
OCR Arena:OCR 模型竞技场
一个用于测试和评估 OCR 模型的免费平台。采用匿名对战模式:上传文档后,两个匿名模型同时进行 OCR 识别,用户对比结果并投票,贡献公共排行榜。
当前排名显示 Gemini 和 Claude 系列模型领先:
- Gemini 2.5 Pro(ELO: 1683,胜率: 72.7%)
- Opus 4.5 Low(ELO: 1650,胜率: 68.3%)
- Opus 4.5 Medium(ELO: 1639,胜率: 70.9%)
- Gemini 3 Preview(ELO: 1638,胜率: 70.8%)
- Gemini 2.5 Flash(ELO: 1629,胜率: 57.2%)
WorldGen:文本生成沉浸式 3D 世界
Meta Reality Labs 推出的端到端系统,可从单个文本提示生成交互式和可导航的 3D 世界。输入"卡通中世纪村庄"或"火星上的科幻基地",几分钟内就能生成跨越 50x50 米的完全纹理化场景。
技术架构包含四个阶段:规划(程序化布局生成)、重建(图像到 3D)、分解(部件提取)、精化(图像增强和纹理)。生成的内容与 Unity 和 Unreal 兼容,无需额外转换。
其他值得关注的工具
Runprompt:单文件 Python 脚本,用于运行 Google 的 .prompt 文件格式。支持模板变量、结构化输出、Prompt 链式调用和多提供商(Anthropic、OpenAI、Google AI、OpenRouter)。项目地址
FAWK:用 Cursor Agent + Sonnet 4.5 在同一天实现的功能性 AWK 变体解释器。展示了 LLM 在编程语言实现方面的能力边界。项目地址
Gibberifier:通过在文本中插入不可见的零宽度 Unicode 字符来阻止 AI 读取内容。已验证对 ChatGPT、Claude、Gemini 等主流模型有效。试用地址
学习资源
v0 系统提示词完整解析
宝玉分享了 v0.dev 的完整系统提示词(约 45,257 个字符,10,397 个 Tokens)并进行了深入解析,总结出 11 个 Prompt Engineering 要点:
结构化的提示词、大量的示例、明确 AI 能力的边界、应用思维链提升推理质量、详尽的指令和规范、明确的拒绝和警告策略、明确角色设定、规范输出格式、语言一致性、支持截图和 URL 生成、先计划再执行。
这是迄今为止最详细的大型 AI 产品提示词工程案例,值得所有 Prompt Engineer 深入学习。
AI 辅助编程学习:打通学习和反馈循环
宝玉分享的 AI 辅助编程学习方法论。核心观点是打通"理解概念 → 动手实践 → 遇到问题 → 解决问题 → 加深理解"的学习循环。
四条实用建议:使用最流行的语言和框架(TailwindCSS、React、Shadcn UI、TypeScript、Next.js)、先能运行再优化(一次只实现一个小功能)、做中学让 AI 解释代码、遇到问题三板斧(重现、精确描述、回滚)。
趋势与思考
小型模型的崛起
FARA-7B 的发布标志着一个重要趋势:小型模型通过专门优化,在特定任务上可以达到甚至超越大模型的表现。仅 70 亿参数,就能在计算机使用任务上领先同规模模型,并且可以本地运行、降低延迟、保护隐私。
这代表了对 AI 发展趋势的重要洞察:不是所有任务都需要最大的模型。小型、专用的模型在很多场景下更实用——更快、更便宜、更安全。
Vibe Coding 的双面性
daily.dev CEO Ido Shamun 分享了使用 vibe coding 和 AI 工具后的真实体验:一方面,生产力大幅提升,可以同时处理多个任务;另一方面,尽管效率很高,但感觉精疲力竭,大脑一直在 100% 使用率。
这触及了一个重要话题:虽然 AI 工具大大提高了生产力,但也带来了新的挑战。开发者需要找到新的方法来管理精力和避免倦怠。高效不等于健康,工具再强大,人的精力也是有限的。
Agent 设计仍然困难
Flask 作者 Armin Ronacher 的分享提醒我们,尽管 AI 能力在快速提升,但 Agent 开发仍然充满挑战。从 SDK 选择到缓存管理,从失败隔离到测试评估,每个环节都需要精心设计。
特别是"测试和评估"被明确指出为"最困难的问题,目前没有令人满意的解决方案"。这说明 Agent 开发还远未成熟,仍有很大的进步空间。
结语
这一周的 AIGC 领域呈现出几个明显的趋势:
模型层面,三大巨头的竞争进入白热化,性能提升的同时更注重实用性(如 Opus 4.5 的 Effort 参数、GPT-5.1-Codex-Max 的超长任务支持)。开源领域,OLMo 3 展示了完全透明的可能性,FARA-7B 证明了小模型的潜力。
工具层面,MCP 协议的演进、Google Antigravity 的发布、Anthropic 高级工具使用功能的推出,都在推动 AI 辅助开发工具的成熟。而 mcp-use 代码模式、Claude Skills 等创新则在探索更高效的交互方式。
实践层面,从 YC 初创公司到数学家 Terence Tao,越来越多的真实案例展示了 AI 工具的实际价值。同时,Flask 作者的经验分享也提醒我们,Agent 开发仍然充满挑战,需要精心设计和持续优化。
AI 正在改变我们工作和创造的方式,但工具的进化也带来新的问题需要我们思考和解决。下周见!
本周刊由 Agili 整理发布,内容来源于 Hacker News、daily.dev、公司官方博客、Telegram 频道等公开渠道。