你好!欢迎阅读第 Y25W51 期 AIGC 周刊。这一周,AI 领域的创新步伐依然飞快:音频 AI 迎来重大突破,编程模型竞相升级,各类开发工具也在不断完善。让我们一起看看这周都有哪些值得关注的进展。

📰 行业资讯

Google 年度回顾:2025 年 8 大研究突破

Google 发布了 2025 年度研究回顾,总结了这一年在 AI 领域的重大进展。文章由 Jeff Dean、Demis Hassabis 和 James Manyika 联合撰写,覆盖以下 8 个方向:

世界级模型突破

Gemini 3 Pro 登顶 LMArena 排行榜,在 Humanity’s Last Exam 等基准测试中创下新纪录。Gemini 3 Flash 以更低成本和延迟提供 Pro 级推理能力,延续了"下一代 Flash 优于上一代 Pro"的趋势。

产品 AI 化

从 Pixel 10 的 AI 功能到搜索中的 AI Mode,再到 NotebookLM 的 Deep Research 功能,AI 正在从工具演变为实用工具。

创意增强

Nano Banana Pro、Veo 3.1、Imagen 4 等生成式媒体模型,以及 Flow、Music AI Sandbox 等创意工具,让 AI 创作更加触手可及。

科学与数学进展

AlphaFold 五周年,已被 190 多个国家的 300 万研究人员使用。Gemini Deep Think 在国际数学奥林匹克和编程竞赛中达到金牌水平。

计算与物理世界创新

Quantum Echoes 算法推动量子计算走向实用,Ironwood TPU 专为推理时代设计,Gemini Robotics 1.5 将 AI Agent 带入物理世界。

全球挑战应对

WeatherNext 2 天气预报速度提升 8 倍,洪水预测覆盖 150 个国家 20 亿人口,FireSat 系统实现更早期的野火发现。

这篇回顾展示了 Google 在 AI 研究和应用方面的全面布局,值得深入阅读。

GLM-4.7:把"能写代码"推进到"能当搭档"

智谱 AI 发布了 GLM-4.7,这是一次主打工程落地能力的重大升级。相较 GLM-4.6,新版本在多个维度实现显著提升:

核心编程能力

  • SWE-bench Verified 达到 73.8%(+5.8%)
  • SWE-bench Multilingual 达到 66.7%(+12.9%)
  • Terminal Bench 2.0 达到 41.0%(+16.5%)
  • 在 Claude Code、Cline、Roo Code 等主流框架中表现更稳定

Vibe Coding / UI 生成

生成的网页更现代、更干净,幻灯片布局与尺寸更准确,整体观感更接近可交付作品。

工具使用与推理

工具调用能力增强,在 τ²-Bench、BrowseComp 等基准测试中表现更好。HLE(Humanity’s Last Exam)带工具达到 42.8%(+12.4%)。

思考机制创新

  • Interleaved Thinking:在回复和调用工具前先思考,提高指令遵循度
  • Preserved Thinking:多轮对话中保留推理块,减少信息丢失
  • Turn-level Thinking:按回合控制推理,简单问题更快,复杂任务更稳

GLM-4.7 已在 Z.ai 平台、OpenRouter 以及各大编程 Agent 工具中上线,权重也已在 HuggingFace 和 ModelScope 开源,支持 vLLM、SGLang 等推理框架。

MiniMax M2.1:面向真实复杂任务的多语言编程升级

MiniMax 发布了 M2.1 模型,专注于提升真实复杂任务中的表现:

多语言编程能力

系统性增强 Rust、Java、Golang、C++、Kotlin、Objective-C、TypeScript、JavaScript 等语言支持,覆盖从底层系统开发到应用层开发的完整链条。

全栈开发提升

显著增强原生 Android 和 iOS 开发能力,提升 Web 和 App 场景的设计理解和美学表达,擅长构建复杂交互、3D 科学场景模拟和高质量可视化。

办公场景适配

增强复合指令约束能力,作为首批系统性引入 Interleaved Thinking 的开源模型之一,问题解决能力进一步升级。

效率优化

响应更简洁,思考链更高效,响应速度显著提升,token 消耗明显降低。

在基准测试中,M2.1 在多语言场景下表现出色,超越 Claude Sonnet 4.5,接近 Claude Opus 4.5。新推出的 VIBE 基准测试(Visual & Interactive Benchmark for Execution)中,M2.1 平均得分 88.6,在 VIBE-Web 和 VIBE-Android 子集中表现尤为突出。

M2.1 已在 MiniMax 开放平台上线 API,产品 MiniMax Agent 也已公开,模型权重已在 HuggingFace 开源。

其他值得关注的资讯

The Illustrated Transformer

这篇 经典文章 通过可视化的方式详细讲解了 Transformer 架构,适合想要深入理解大模型底层原理的读者。它已被 Stanford、Harvard、MIT、Princeton、CMU 等顶级高校的课程采用。

PoliBench - 比较 AI 模型的政治偏见

PoliBench 是一个用于比较不同 AI 模型政治偏见的工具,通过 62 个政治问题评估模型在经济维度(左-右)和社会维度(威权-自由)上的立场倾向。测试涵盖了 40 个主流 AI 模型,包括 GPT、Claude、Gemini、DeepSeek 等系列。

Bloom:自动化生成"行为评估"的开源框架

Anthropic 开源的 Bloom 框架,用于自动化生成 AI 模型的行为评估,帮助开发者更好地理解模型表现。

Cloudflare Vectorize 构建搜索引擎

Cloudflare 博客 文章 展示如何用 Vectorize 产品快速构建向量搜索引擎,实现强大的语义搜索能力。

测量 AI 完成长任务的能力

METR 的 研究文章,探讨如何评估 AI 模型完成长时程、复杂任务的能力。

结构化输出产生虚假信心

Boundary ML 的 研究 发现,当 AI 模型以结构化格式输出时,可能会表现出不合理的高置信度。

“世界模拟器的黎明”

Odyssey.ml 的文章 探讨 AI 世界模型发展趋势的深度分析。

通用推理模型突破

研究论文 显示,最新的通用推理模型在抽象推理测试(ARC)中取得新突破,ARC1 达到 53.8% pass@1,ARC 2 达到 16.0%。

Moravec 悖论与机器人奥林匹克

Physical Intelligence 的 博客文章 探讨为什么对人类来说简单的任务对 AI 反而困难,以及机器人技术的发展方向。

LangChain Core 关键漏洞 CVE-2025-68664

Cyata 安全研究员发现 LangChain Core 的关键安全漏洞,编号 CVE-2025-68664,这是一个反序列化漏洞,影响范围广泛。LangChain 已发布补丁版本,建议用户及时更新。

Don’t do RAG, CAG is all you need for knowledge tasks

这篇文章 提出了 CAG(Cache-Augmented Generation)方法,认为在某些知识任务中,CAG 比 RAG 更有效。CAG 通过预加载知识到缓存,在延迟和一致性上优于 RAG,但在数据新鲜度上略逊一筹。

🤖 模型动态

Meta SAM Audio:革新音频编辑的 AI 模型

Meta 发布了 SAM Audio,这是首个能够使用文本、视觉和时间跨度提示从复杂音频混合中分割声音的统一 AI 模型。

三种提示方式

  1. 文本提示:输入"dog barking"或"singing voice"提取特定声音
  2. 视觉提示:点击视频中发出声音的人或物体以隔离音频
  3. 时间跨度提示:标记目标音频出现的时间段(行业首创)

应用场景

  • 音乐制作:从混音中提取分轨,重新混音和母带处理
  • 播客和广播:移除背景噪音,隔离多个说话者
  • 影视制作:ADR 准备,声音设计和 Foley 艺术
  • 科学研究:生物声学研究,环境噪声分析
  • 无障碍访问:为听力障碍用户增强特定声音

技术特性

  • 统一模型架构,支持多种用例和提示方式
  • 在各种真实场景中达到最先进性能
  • 端到端可微分架构

你可以在 Segment Anything Playground 中试用 SAM Audio,或访问 ai.meta.com/blog/sam-audio 下载模型。

🛠️ 开发工具

Claude Code 获得原生 LSP 支持

Claude Code 现已支持原生 LSP(Language Server Protocol),这意味着它可以更好地理解代码结构、提供更准确的代码补全和导航功能。

2.0.74 版本的主要更新:

  • 添加 LSP 工具,支持 go-to-definition、find references 和 hover documentation
  • 支持 Kitty、Alacritty、Zed、Warp 等终端的 /terminal-setup
  • 改进 /context 命令可视化,按来源分组 skills 和 agents

Gemini 3 Flash 加速搜索子 Agent

Amp Code 的代码库搜索子 Agent 现在使用 Gemini 3 Flash 替代 Haiku 4.5,速度提升 3 倍且质量相当。

Gemini 3 Flash 在并行工具调用方面表现更好,每次迭代平均发起约 8 个并行调用(Haiku 4.5 约 2.5 个),并且能在约 3 轮对话中完成任务(Haiku 4.5 约 9 轮)。

长时运行 Agent 的有效框架

Anthropic 工程博客发布了 《长时运行 Agent 的有效框架》,分享了构建稳定、可靠的长时程 AI Agent 的最佳实践。

文章提出了双重解决方案:

  1. 初始化智能体:在首次运行时设置环境,包括功能列表、git 仓库等
  2. 编码智能体:在每个会话中负责取得增量进展,通过 git 提交和进度文件保持状态

关键策略包括:编写全面的功能需求文件、一次只处理一个功能、使用浏览器自动化工具进行端到端测试、通过 git 管理代码版本等。

Asterisk AI Voice Agent - 开源 AI 语音代理

Asterisk AI Voice Agent 是一个开源的 AI 语音代理框架,支持实时语音对话、多语言识别和自然语言理解。可以用于构建客服机器人、语音助手等应用。

MCP Config 转换器

mcp-config 是一个参考实现,把同一份 MCP Server 配置一键转换成不同应用所需的配置文件或命令,避免在 Claude Desktop、Cursor、VS Code 等多处重复手工改配置。

Vibium - 为 AI Agent 和人类设计的浏览器自动化工具

Vibium 是一个专为 AI Agent 设计的浏览器自动化工具,提供了简洁的 API 和强大的页面交互能力,让 AI 可以像人类一样浏览和操作网页。

特性包括:

  • 浏览器自动化:支持 Playwright 和 Selenium
  • AI 集成:与 Claude、OpenAI 等模型无缝集成
  • 工具生态:支持 MCP 服务器、LangChain 工具等
  • 可观测性:内置日志和监控

AI SDK 6:从"调用模型"到"构建可复用智能体"

Vercel AI SDK 6 带来重大升级,引入了智能体(Agent)抽象,让开发者可以更方便地构建和复用 AI 智能体。

新特性:

  • Agent 抽象:更高级的智能体构建方式
  • 改进的流式响应
  • 增强的工具调用能力
  • 更好的上下文管理

Mysti - 多模型协作的 AI 编程团队

Mysti 让 Claude、Codex 和 Gemini 协同工作,形成一个 AI 编程团队。不同模型各司其职,共同完成复杂的编程任务。

WiFi DensePose:穿墙的人体姿态估计

WiFi DensePose 通过 WiFi 信号实现穿墙的人体姿态估计,无需摄像头即可感知人体动作。

技术特性:

  • 隐私优先:不使用摄像头
  • 实时处理:50ms 以下延迟,30 FPS
  • 多人追踪:同时追踪最多 10 人
  • 穿墙检测:可穿墙和障碍物检测

应用场景包括医疗保健(跌倒检测)、智能家居(占用检测)、安全监控等。

GIA Agentic Research Pipeline - 自主 AI 学术研究系统

GIA 是一个完全自主的学术研究管道,能够从项目接收到可审计的研究输出:文献综述、结构化证据提取、可选计算和论文起草。

核心特性:

  • 25 个专门的 AI Agents,覆盖从接收分析到写作的全流程
  • 模式优先方法,JSON 模式视为契约
  • 门禁系统,输入不完整时阻止或降级
  • 优雅降级,可选组件失败时管道继续运行

本地编码模型指南

这篇指南 介绍了如何使用本地部署的开源模型进行编程,包括模型选择、部署方法和性能对比。

作者分享了使用 MacBook 运行本地编码模型的经验,包括内存管理、量化技术、工具选择等实践经验。虽然作者后来修正了观点,认为本地模型在性能高峰时无法与前沿模型竞争,但对于个人项目和特定场景仍有价值。

扩展 LLM 到更大的代码库

这篇文章 探讨了如何让 LLM 有效处理大型代码库,核心观点是投资于"指导"和"监督":

指导(Guidance):

  • 编写 prompt 库,汇总文档和最佳实践
  • 环境就是上下文,保持代码整洁和模块化
  • 让代码对 LLM 可读

监督(Oversight):

  • 投资于团队的设计能力
  • 培养架构思维
  • 建立自动化的安全检查

ExecuTorch - PyTorch 的端侧 AI 框架

ExecuTorch 是 PyTorch 推出的端侧 AI 框架,支持在移动设备、嵌入式设备和边缘设备上运行模型。

核心优势:

  • 原生 PyTorch 导出,无需格式转换
  • 极小运行时,50KB 基础占用
  • 12+ 硬件后端支持
  • 为 Meta 数十亿用户提供实时端侧推理

支持的模型包括 Llama 3.2、Qwen 3、Phi-4-mini、Llava(视觉-语言)、Voxtral(音频-语言)等。

用 Payload CMS + Vercel AI SDK 搭建"可运营"的 AI 应用

这篇文章 分享了如何结合 Payload CMS 和 Vercel AI SDK 构建既有 AI 能力又易于运营管理的应用。

使用 Payload CMS 做"可视化、可配置的 AI 后端",用 Vercel AI SDK 做"结构化生成与工具调用的运行层",形成一条从配置、执行到观测的闭环。

AntV Infographic:面向 AI 时代的声明式信息图引擎

AntV Infographic 是蚂蚁集团推出的声明式信息图引擎,支持通过自然语言或简单配置生成复杂的数据可视化图表。

GitHub Copilot Coding Agent

GitHub Copilot coding agent 可以帮你批量处理积压的编程任务,自动生成代码、修复 bug、编写测试等。

Building an AI Agent Inside a 7-Year-Old Rails Monolith

这篇 案例研究 分享了如何在一个运行 7 年的 Rails 单体应用中集成 AI Agent,包括遇到的挑战和解决方案。

2025 年 AI 编程现状

Greptile 的综述文章 总结了 2025 年 AI 编程领域的发展趋势,包括:

  • LiteLLM 月下载量增长 4× 至 41M
  • 工具生态快速发展
  • 模型能力持续提升
  • 实际应用效果显著改善

TurboDiffusion:视频扩散模型加速 100-200 倍

TurboDiffusion 通过优化算法将视频扩散模型的生成速度提升 100-200 倍,让实时视频生成成为可能。

Sharp Monocular View Synthesis

这项研究 实现了在 1 秒内从单目图像合成清晰的多视角图像,大幅提升了 3D 重建和视图合成的效率。

Agentic Review - AI 代码审查

Amp Code 的新 Agent 专门用于代码审查,可以自动检查代码质量、发现潜在问题并提出改进建议。

10 秒内获得 AI 代码审查

这篇文章 分享了一个技巧,通过 AI 快速识别常见问题和最佳实践违规,在 10 秒内完成代码审查。

📝 结束语

这一周,我们看到了音频 AI 的重大突破,编程模型的持续进化,以及各类开发工具的不断完善。从 Meta 的 SAM Audio 到智谱的 GLM-4.7,再到 MiniMax 的 M2.1,AI 模型正在变得更加实用、更加强大。

Google 的年度回顾让我们看到,AI 正在从工具演变为实用工具,从单纯的辅助功能成长为可以独立完成复杂任务的智能体。这个趋势在各类 Agent 框架和编程工具的发展中也得到了印证。

值得注意的是,本地部署和隐私保护也成为重要趋势。从 ExecuTorch 的端侧推理到 WiFi DensePose 的隐私优先设计,AI 技术正在变得更加可及和负责任。

下周,我们将继续关注 AIGC 领域的最新动态。如果你有任何想要分享的内容或建议,欢迎随时联系我。

祝周末愉快!