Agili 的 AIGC 周刊(Y25W50)
这一周,AI 领域的两位重磅人物不约而同地发布了年终总结。Karpathy 和 Redis 作者 antirez 都在复盘 2025 年时提到同一个关键词:RLVR(强化学习 + 可验证奖励)。与此同时,OpenAI 和 Google 都发布了重磅模型。而 Anthropic 和 OpenAI 又在同一时间推出了 Skills 功能。这个巧合让人感叹,行业节奏真快。
更有趣的是,一项针对 1250 人的深度访谈揭示了什么?85.7% 的人在使用 AI 时仍处于"认知失调"状态。但数据不会撒谎。AI 编码的占比已经从年初的 11% 飙升到 50% 以上。矛盾吗?也许这正是技术变革的真实写照。
资讯
Karpathy 年度回顾:RLVR 改变了一切
Andrej Karpathy 在他的 年度回顾 中,总结了 2025 年 LLM 领域的六个重大转变:
RLVR 突破是今年最重大的技术进展。强化学习与可验证奖励的结合,让 LLM 能在数学、编程等可验证环境中自发形成推理策略。OpenAI o3 的发布标志着这个拐点的到来。
“幽灵” vs "动物"是个有趣的比喻。Karpathy 认为,我们不是在进化动物,而是在召唤幽灵。LLM 展现出极不稳定的性能特征,基准测试容易被 RLVR 优化,这让他对基准测试失去了信任。
Cursor 的崛起代表了新的 LLM 应用层次。它不只是简单的对话界面。它做好了上下文工程,编排多个 LLM 调用,提供特定应用 GUI 和自主性滑块。
Claude Code 范式是首个真正令人信服的 LLM Agent。关键在于它运行在你的本地电脑上。你可以访问私有环境和数据,提供低延迟交互。
Vibe Coding 标志着 AI 跨越了能力门槛。你可以仅通过英语构建复杂程序。编程不再是专业人员的专利,代码变得免费、短暂、可塑。
Nano Banana/LLM GUI 是 Google Gemini Nano 展示的新方向。它将文本生成、图像生成和世界知识融合,这是"LLM GUI"的早期雏形。
Karpathy 最后说,即使在当前能力水平下,对 LLM 的潜力开发还不到 10%。
Redis 作者看 AI:"随机鹦鹉"已死
Redis 作者 antirez 在 他的博客 中,用更简明的方式表达了类似观点:
-
"随机鹦鹉"论已被证伪。2025 年几乎所有人都承认,LLM 确实形成了对概念的内部表征。
-
思维链的本质是模型表征中的采样(内部搜索),以及与强化学习结合学会的 token 级放置策略。
-
强化学习是下一个大事件。"缩放受限于可用 token 数量"不再成立,可验证奖励的 RL 打破了这一限制。
-
编程抵抗显著降低。LLM 交付有用代码的能力已经提升到让大多数怀疑者开始使用的程度。
-
Transformer 替代探索正在进行。知名 AI 科学家正探索 Transformer 替代方案、带符号表征的模型和世界模型。
-
CoT 未改变 LLM 本质。LLM 仍是相同架构、相同的下一个 token 目标,本质未变。
-
ARC 测试不再不可逾越。它从"反 LLM 测试"转变为"LLM 的验证"。
-
未来 20 年的根本挑战:避免灭绝。
85% 的人仍在与 AI"认知失调"中挣扎
Playbook Atlas 对 Anthropic 的 1250 份 AI 使用访谈 进行了结构化分析。结果揭示了与官方"积极为主"叙事截然不同的真相。
85.7% 的人存在未解决的张力。认知失调是常态而非例外。
访谈对象被分为三个群体:
- 创意工作者(134 人):挣扎分数 5.38,71.7% 面临身份威胁,但 74.6% 正在增加 AI 使用
- 普通员工(1065 人):挣扎分数 4.01,务实的中间派
- 科学家(51 人):挣扎分数 3.63,找到了健康基线
主要张力类型包括:效率 vs 质量(19%)、效率 vs 真实性(15.7%)、便利 vs 技能(10.2%)等。
幻觉是头号信任破坏者(121 次提及)。AI 以自信的方式犯错,比错误本身更具破坏性。
创意工作者的内疚感最强。52.2% 通过"真实性"框架看待 AI 使用,83% 表达内疚的人将真实性作为伦理框架。
科学家的秘诀是什么?将 AI 视为工具而非合作者。总是验证,保持心理距离,让身份取决于方法而非输出。
研究还揭示了一些浮现的不成文规则。永远不要让 AI 生成的内容未经审查就离开办公桌。假设 AI 是错的直到验证。用于初稿不用于最终输出等。
这项研究本身也是 AI 应用的典范。使用 GPT-4o-mini 结构化输出,处理 47 个维度、58750 个数据点,成本仅 $0.58,缓存命中率 72.7%,成功率 100%。
DeepMind 开源最大可解释性工具套件
Google DeepMind 发布 了 Gemma Scope 2。这是迄今为止 AI 实验室发布的最大规模开源可解释性工具套件。
它为整个 Gemma 3 家族(从 270M 到 27B 参数)提供完整工具。存储约 110 PB 数据,训练超过 1 万亿总参数。
核心功能包括:在每一层训练的稀疏自编码器(SAE)和转码器。skip-transcoders 和跨层转码器使解析多步计算更容易。使用 Matryoshka 等最新训练技术,以及针对 Gemma 3 聊天版本的分析工具。
你可以用它分析越狱、拒绝机制、思维链忠实性等复杂多步骤行为。所有资源在 Hugging Face 开源,Neuronpedia 提供可视化,还有技术报告和 Colab 教程。
AI 编码爆发:从 11% 到 50% 的跃迁
OpenRouter 与 a16z 合作发布的 2025 年 AI 状况报告,基于超过 100 万亿个 token 的分析,揭示了几个重要趋势:
编码正在崛起:编程查询从 2025 年初的 11% 飙升至年底的 50% 以上,成为所有模型中增长最快的类别。
工具使用增强:优化推理和工具使用的模型现在处理总 token 的 50% 以上。
Anthropic 热潮:Claude 系列(特别是 Sonnet)在 2025 年大部分时间主导编程领域,拥有 60% 以上市场份额。
开放权重增长:开源模型从最小增长到约占总使用量的三分之一。主要由中国实验室的高竞争开源模型推动。
"灰姑娘玻璃鞋"效应:早期用户的参与持续时间远长于后来队列。典型 4 个月保留率 10-20%,但 Claude Sonnet 4 发布队列在第 4 个月保留了约 40%。
关键发现是什么?早期采用迫使你首先解决集成问题。掌握将 AI 辅助编织到 IDE、管道和审查流程的开发者,获得了巨大、持续的效率领先优势。
Cursor 收购 vs Kilo 自建:两种产品哲学
Cursor 收购 Graphite 用于代码审查,而 Kilo 选择自己构建。这展示了两条不同的产品路径。
Cursor 的方法是收购和集成。它购买了现有工具 Graphite,计划在 2026 年进行"更深入的集成"。Graphite 在今年 3 月筹集了 5200 万美元。
Kilo 的方法是自己构建。两周前就在平台内发布了代码审查功能。自动分析 PR 并提供内联 AI 反馈,涵盖性能、安全性、样式和测试覆盖率。
Kilo 认为原生构建的优势在于:上下文自然流动,审查中标记的问题可为下次编码会话提供信息,一键部署,避免不必要的摩擦。
模型锁定也是个问题。Cursor 使用 Anthropic 的 Claude,Graphite 也是 Anthropic 支持,这可能影响模型选择的开放性。Kilo 的立场是可以从 500 多个模型中选择任何任务,可在会话中切换模型。
定价方面,Kilo 按 token 付费。代码审查、云代理、托管索引都是平台的一部分,无隐藏成本。
Sora Android 幕后:4 人写 15% 的代码,AI 负责其余
Sora 的 Android 客户端 App 大约 85% 的代码是 AI 写的。发布首日 生成超 100 万条视频,无崩溃率 99.9%。
开发方法的核心是:
架构先行:人先搭好架子,再让 AI 来填空。先定义整体架构,手写代表性功能作为范本,写大量 AGENTS.md 文件作为 AI 的新人手册。
先规划再写代码:先让 AI 理解系统。再让 AI 出实现计划。人确认计划后 AI 才动手。
并行开发:多个 Codex 任务同时跑。工程师从写代码变成做决策和给反馈。
AI 是最好的跨平台框架:参考 iOS 代码生成 Android 代码。AI 擅长这种翻译工作。
关键经验是什么?先设计架构再让 AI 填空。先规划再写代码让 AI 充分理解上下文。给 AI 好的参考让它照葫芦画瓢。代码在变得廉价,但品味在变得昂贵。
Anthropic 破解难题:让 Agent 跨上下文窗口工作
Anthropic 开发了 双重解决方案,使 Claude Agent SDK 能够跨多个上下文窗口有效工作。
核心挑战是让 Agent 在多个上下文窗口中保持一致进展。每个新会话开始时都没有之前的记忆。
双重解决方案包括:
初始化 Agent:首次运行时设置环境。设置 init.sh 脚本,创建 claude-progress.txt 日志文件,创建初始 git 提交,编写全面的功能需求文件(200 多个功能)。
编码 Agent:每个会话致力于增量进展。一次只处理一个功能,通过 git 提交和进度更新结束会话,使用浏览器自动化工具端到端验证。
快速上手流程很简单。运行 pwd 查看工作目录。阅读 git 日志和进度文件。阅读功能列表文件并选择未完成功能。
模型
OpenAI 发布 GPT-5.2-Codex
OpenAI 发布 GPT-5.2-Codex。这是迄今为止最先进的代理编码模型,专为复杂的实际软件工程任务设计。
核心改进包括:长时程工作的原生上下文压缩,大型代码变更性能增强(重构和迁移),Windows 环境改进,网络安全能力显著增强。
在 SWE-Bench Pro 和 Terminal-Bench 2.0 上达到最先进性能。
网络安全方面有重大突破。安全研究员 Andrew MacPherson 使用该模型发现了 React Server Components 中的三个安全漏洞。
部署策略包括:向所有付费 ChatGPT 用户的 Codex 界面发布,未来几周为 API 用户启用,试点"可信访问计划"为经过审查的专业人士提供更强大模型。
Google 发布 Gemini 3 Flash
Google 发布 Gemini 3 Flash。它专为速度和效率设计,同时保持前沿级智能。
性能突破令人印象深刻:
- GPQA Diamond: 90.4%
- Humanity’s Last Exam: 33.7%(无工具)
- MMMU Pro: 81.2%
- SWE-bench Verified: 78%(超越 Gemini 3 Pro)
速度与成本优势明显:比 Gemini 2.5 Pro 快 3 倍且性能更优。输入 $0.50/百万 token,输出 $3/百万 token,处理日常任务平均使用的 token 比 2.5 Pro 少 30%。
已在 Google AI Studio、Gemini CLI、Antigravity、Gemini 应用、Vertex AI 全球推出。JetBrains、Bridgewater Associates、Figma、Cursor、Warp 等企业已开始采用。
应用场景包括代码开发、多模态推理、交互式应用(游戏助手、A/B 测试等)。
小米发布 MiMo-V2-Flash
小米于 2025 年 12 月 16 日 发布并开源 MiMo-V2-Flash。这是一款高效、超快的基础语言模型。
模型架构采用 MoE,总参数 309B,激活参数仅 15B,支持 256K 超长上下文。
性能表现优异:AIME 2025、GPQA-Diamond 等推理测试位列开源模型前二,SWE-bench Verified 达 73.4%,SWE-bench Multilingual 达 71.7%,推理速度 150 tokens/秒,成本仅 $0.1/百万输入 token。
技术创新包括:
- 多 Token 预测(MTP):通过自推测解码实现 2.0-2.6 倍加速
- MOPD 训练范式:多教师在线策略蒸馏,训练效率提升 50 倍以上
已通过 MIT 协议开源,推理代码已贡献至 SGLang。
工具
Anthropic 推出组织级 Skills 管理
Anthropic 推出 Claude Skills 的三大重要更新。这使技能更易于部署、发现和构建。
组织级管理:Claude Team 和 Enterprise 管理员可集中配置技能,默认为所有用户启用。
合作伙伴 Skills 目录:包括来自 Cloudflare、Figma、Sentry、Vercel、Zapier、Atlassian、Canva 等的预构建技能。
简化创建流程:
- 描述即创建:Claude 帮助构建
- 复杂工作流:上传技能文件夹或使用技能创建器
- 编辑功能:Claude 可帮助编辑现有技能
- 预览功能:启用前准确了解技能作用
Anthropic 还将 Agent Skills 发布为开放标准,实现跨平台可移植性。
Skills 和 MCP:货架与店员的完美配合
Anthropic 详细阐述 Skills 和 MCP 如何协同工作,以及何时使用其中之一。
核心关系很清晰:
- MCP:处理连接性,提供对外部系统的安全、标准化访问
- Skills:处理专业知识,提供将原始工具访问转化为可靠结果的领域知识和工作流逻辑
打个比方:MCP 就像能够访问商店的货架,Skills 就像店员的专业知识。
结合优势包括:清晰的发现(Claude 不再猜测去哪里查找)、可靠的编排(多步骤工作流变得可预测)、一致的性能(输出实际符合标准)。
真实案例包括:
- 金融分析:自动化公司估值 Skill + S&P Capital IQ 等 MCP 服务器
- 会议准备:Meeting Intelligence Skill + Notion MCP 服务器
使用指南:Skills 用于多步骤工作流、一致性重要的流程、领域专业知识、团队工作流;MCP 用于实时数据访问、外部系统操作、文件操作、API 集成。
Gemini 3 Flash 反超 Pro 版本
Kilo Code 对 Google 新发布的 Gemini 3 Flash 进行 编码测试。结果出人意料。
总体得分:
- Gemini 3 Flash: 90% 平均分,$0.17 成本,2.5 分钟
- Gemini 3 Pro: 84.7% 平均分,$1.10 成本,9 分钟
测试方法包括三个编码挑战:提示遵守测试(Python 速率限制器)、代码重构测试(365 行 TypeScript API 处理程序)、系统扩展测试(通知系统架构分析和扩展)。
性能优势明显:高 7 分,便宜 6 倍,快 3 倍。在 SWE-bench Verified 上达到 78%,击败 Gemini 2.5 Pro 和 Gemini 3 Pro。
定位是什么?Flash 级别的速度和成本提供 Pro 级别的推理能力。
建议:在架构师模式使用昂贵模型规划,切换到 Gemini 3 Flash 的代码模式实现。
Slack 消息直接变成 Pull Request
Continue 的 Slack 云端 Agent 通过 MCP 集成,将 Slack 对话转化为跨 GitHub、Linear 和代码库的实际行动。
核心功能包括:
“Drive-By” 修复:将 Slack Bug 报告转换为 Pull Request。查看选定代码仓库,创建 Linear 工单,修改代码,自动创建 GitHub PR。
Slack 作为 Linear 控制平台:通过 Slack 消息更新分配、状态、评论、关联工单。
处理安全漏洞:实际案例展示了如何处理权限检查漏洞。搜索定位相关路由器,读取理解当前实现,分析发现安全漏洞,修复并清理 TypeScript 错误,创建 PR。
关键优势:线程上下文(Agent 读取整个对话线程)、Mission Control(实时观察 Agent 工作)、心流状态(保持在高效工作状态)。
OpenAI 开放应用商店,Skills 悄然上线
OpenAI 宣布 开发者可以提交应用程序以供审核并发布到 ChatGPT 中。
应用目录位于工具菜单或 chatgpt.com/apps。你可以浏览精选应用或搜索已发布应用,还支持从其他平台直接深度链接。
触发机制包括:@提及名称,从工具菜单选择,实验性智能推荐(根据对话上下文、使用模式和用户偏好推荐)。
构建和提交:Apps SDK 进入 beta 阶段,通过 OpenAI 开发者平台提交,审核标准是质量和安全,有机会被精选以获得更突出展示。
货币化方面,早期阶段可以链接到自己网站完成实体商品交易,正在探索其他货币化选项(包括数字商品)。
有趣的是,ChatGPT 代码解释器已经悄悄采用了 Skills。在 /home/oai/skills 有新文件夹,涵盖处理电子表格、docx 和 PDF。
当 EA 停止用 AI 做助手,而是做基础设施
Zapier CEO 执行助理 Cortney Hickey 展示 了当你停止将 AI 作为助手,而开始将其作为基础设施时会发生什么。
核心理念:AI 不会取代 EA,而是将他们转变为力量倍增器。在整个公司范围内扩展高管思维、文化和战略。
主要收获:
-
自动化重复任务:如果每周都做,花时间自动化它。初期投资在之后每一周都会带来回报。
-
创建高管的 AI 版本:构建像 CEO 一样思考的 GPT。允许任何人在正式审查前获得关于战略文档的反馈。
-
进步胜于完美:从基本功能开始并迭代改进。防止完美主义阻碍自动化进度。
-
AI 知识库:在 NotebookLM 中构建战略伴侣。接收所有战略文档,允许员工以对话方式查询。
具体实践包括:会议准备自动化(使用 Zapier Agents 自动化研究参与者、检查 CRM、提供见解),文化强化系统(自动化会议反馈,与公司价值观保持一致),高管文档审查(帮助团队在正式审查前与高管期望保持一致),中心化知识库(使公司战略对所有员工可访问和互动)。
结语
这一周的 AI 圈,技术突破和实践案例并行。从 Karpathy 和 antirez 的年度总结,我们看到 RLVR 已成为行业共识的下一个大事件。从 OpenAI 和 Google 的模型发布,我们看到性能和成本的边界正在被重新定义。从 Anthropic 和 OpenAI 的 Skills 推出,我们看到 AI Agent 生态正在加速成熟。
更重要的是,从那 1250 份访谈中,我们看到了技术变革的真实面貌。85% 的人仍在挣扎,但这并不妨碍 AI 编码从 11% 飙升到 50%。认知失调与快速采用并存,这或许就是我们这个时代的特征。
下周见。