Agili 的 AIGC 周刊(Y25W45)
你好,我是 Agili。
本周 AIGC 领域格外热闹。柯林斯词典将"Vibe Coding"评为 2025 年年度词汇,这个由 Andrej Karpathy 在年初提出的概念,仅用九个月就从程序员的玩笑变成了正式术语,标志着开发范式的根本性转变——程序员不再逐行编写代码,而是成为指导 AI 的"导演"。
与此同时,Anthropic 推出的 Claude Skills 和 Agent SDK 为智能体开发提供了系统化方法,字节跳动发布了代理优先的 Doubao Seed Code,AI 编程工具的竞争进入白热化阶段。而在生成领域,李飞飞的 World Labs 公测了 3D 世界模型 Marble,StreamDiffusionV2 实现了 60+ FPS 的实时视频生成,技术突破令人目不暇接。
更令人深思的是,通过对 9 个主流 AI 模型的测试,研究者揭示了智能体能力金字塔:即便是 GPT-5 和 Claude Sonnet 4.5 这样的顶级模型,失败率仍超过 40%。常识推理仍然是 AI 的最大短板,2025 年或许只是"智能体们终于能够足够连贯地行动"的元年。
让我们一起看看本周的精彩内容。
资讯
Vibe Coding 成为 2025 年年度词汇 📖
柯林斯词典将"Vibe Coding"评为 2025 年年度词汇,正式定义为"使用自然语言提示让人工智能辅助编写计算机代码的行为"。
这个概念由 Andrej Karpathy(OpenAI 联合创始人、特斯拉前 AI 负责人)在 2025 年 2 月的一条推文中推广。他半开玩笑地说:“有一种新的编程方式,我称之为 vibe coding。你完全凭感觉,拥抱指数增长,忘记代码本身。”
这条推文迅速在 Hacker News 和 Reddit 传播,九个月后,这个术语正式进入柯林斯词典。这标志着一场编程史上最反直觉的革命:理性让位于感觉,程序员从编码者变成导演。
Lovable 平台的数据最能说明这一趋势:接近 800 万用户,每天有 10 万个新产品在该平台上构建。Cursor、Replit、Vercel、GitHub Copilot 等工具共同构成了这场革命的基础设施。
原文链接: https://eu.36kr.com/en/p/3546802998751367
Claude Skills: 按需加载的动态上下文 ⚡
Claude 推出了 Skills 功能,这是一种优雅解决上下文窗口污染问题的方案。
传统做法是将所有领域知识塞进系统提示词,导致即便在处理简单任务时也要携带大量无关信息。Skills 将领域知识封装成独立的 Markdown 文件,Claude 可以在需要时动态加载,用完即走。
这个功能特别适合解决前端设计中的"千篇一律"问题。没有 Skills 时,Claude 会本能地选择最"安全"的设计:Inter 字体、白底配紫色渐变、可有可无的动画。有了 Skills,你可以创建一个前端设计技能包,只在生成 UI 时才激活,避免在调试 Python 代码时也携带这些设计规范。
核心优势:
- Skills 是可复用的提示词和知识库,随叫随到
- 解决上下文窗口污染问题
- 避免 AI 生成千篇一律的设计
- 提供一种优雅的方式管理专业知识
原文链接: https://claude.com/blog/improving-frontend-design-through-skills
Claude Agent SDK: 给智能体一台电脑 🖥️
Anthropic 将 Claude Code SDK 更名为 Claude Agent SDK,体现了从编码工具到通用智能体框架的转变。
核心设计理念是"给智能体一台电脑,让它们像人类一样工作"。通过赋予 Claude 运行 bash 命令、编辑文件、创建文件和搜索文件的能力,它可以处理各种数字工作,不仅限于编程。
智能体循环框架:
- 收集上下文: 文件系统、子智能体、压缩
- 采取行动: 工具、Bash、代码生成、MCP
- 验证工作: 规则、视觉反馈、LLM 评判
这个框架可以构建多种类型的智能体:
- 金融智能体: 通过 API 和代码计算评估投资
- 个人助理: 预订旅行、管理日历、整理简报
- 客户支持: 处理模糊请求,连接外部 API
- 深度研究: 在大型文档集中搜索、分析、综合信息
原文链接: https://baoyu.io/translations/building-agents-with-the-claude-agent-sdk
AI 智能体能力金字塔:真实水平几何? 📊
通过在 RL 环境中测试 9 个主流 AI 模型,研究者揭示了一个残酷的现实:即便是 GPT-5 和 Claude Sonnet 4.5 这样的顶级模型,失败率仍超过 40%。
四层能力金字塔:
- 基础层: 工具使用、规划与目标设定
- 第二层: 适应性(当计划遭遇阻碍时能否调整)
- 第三层: 接地气(避免幻觉、保持上下文一致性)
- 第四层: 常识推理(面对陌生情况的表现)
GPT-4o、Mistral Medium 和 Nova Pro 停留在基础层,在基础的工具使用和规划上仍存在明显问题。Gemini 2.5 和 Qwen3 模型在适应性上经常出问题,执行了一系列合理操作后,当某个步骤出错时却毫无反应。
最有趣的发现是:常识推理是导致 GPT-5 与人类水平产生差距的主要原因。 2025 年是"智能体之年",但这并不意味着我们实现了通用强智能体,而是"智能体们终于能足够连贯地行动,以至于我们可以开始分析和讨论它们的常识推理能力"的元年。
原文链接: https://baoyu.io/translations/rl-envs-real-world
行业动态速递 📰
图灵奖得主 Yann LeCun 即将离开 Meta 计划创办自己的 AI 创业公司,这一消息在 AI 行业引起广泛关注。 https://www.nasdaq.com/articles/metas-chief-ai-scientist-yann-lecun-depart
Fireflies AI 达到 10 亿美元估值 推出"Talk to Fireflies"AI 会议助手应用后,这家 AI 会议记录创业公司正式跻身独角兽行列。
OpenAI 群聊功能上线 支持搜索、图像和文件上传、图像生成以及听写功能。ChatGPT 会根据群聊上下文智能决定何时回复、何时保持沉默,还具备群组管理能力。
Python 3.14 正式发布 带来 t-strings、延迟类型注解、改进的 REPL(支持语法高亮)、多解释器支持,以及可选的自由线程构建(不需要 GIL)。 https://realpython.com/python314-news/
AI 对劳动力市场的影响 智库研究显示,从 2022 年到 2025 年中期,受 AI 影响最大的五分之一劳动者,其失业率仅上升了 0.3 个百分点。这一数据挑战了 AI 将大规模取代人类工作的预测。
模型
Doubao Seed Code: 代理优先的编码新范式 🤖
字节跳动发布的 Doubao Seed Code 是一个代理优先的编码模型,采用"先计划,后开发"的工作模式。
结构化工作流:
- 提出包含组件、依赖项和测试想法的计划
- 搭建最小代码和测试存根
- 运行检查并检测失败
- 进入修复循环:有针对性的差异、回归意识
核心优势在于可审计的步骤。你可以检查计划、差异、测试,并决定是否继续,而不是一次性生成大量代码。
技术亮点:
- 32K 上下文窗口(官方定价页面)
- 多模态支持:从截图/规范到工作组件
- SWE-Bench Verified 达到 78.8%
- 媒体报道与 Claude Code 近乎即插即用兼容
实际案例:有用户用 Trae(字节的 AI 编程工具)的 Max 模式(使用 GPT-5 high,272k 上下文)花 3 美元完成了超级复杂的 AI 健身数据分析产品。
原文链接: https://skywork.ai/blog/vibecoding/doubao-seed-code-ai-coding-2025/
GPT-5.1 与 Claude 结构化输出 🔄
OpenAI 发布 GPT-5.1 新版本在推理能力、代码生成和多语言支持方面都有显著提升。 https://openai.com/index/gpt-5-1/
Claude 结构化输出功能上线 Anthropic 为 Claude 添加了结构化输出功能,允许开发者指定输出格式,使 API 集成更加可靠和便捷。这对于需要稳定 JSON 输出的应用场景特别有价值。 https://www.anthropic.com/news/structured-outputs
GitHub Copilot 的 Raptor mini 模型 GitHub 悄悄发布了 Raptor mini,这是一个为 Copilot 微调的 GPT-5-mini 模型。关键特性包括 264k 上下文窗口、64k 输出能力,针对多文件工作区任务、工具调用和 VS Code 内的代码编辑进行优化。这为开发者提供了更好的大型代码库处理能力。
StreamDiffusionV2: 60+ FPS 的实时视频生成 🎬
StreamDiffusionV2 是一个用于视频扩散模型交互式实时流的免训练管道,实现了真正的实时交互式视频生成。
技术创新:
- SLO 感知批处理调度器
- Sink-token 引导的滚动 KV 缓存
- 运动感知噪声控制器
- 可扩展的管道编排
性能表现(四个 H100 GPU):
- 14B 参数模型: 58.28 FPS
- 1.3B 参数模型: 64.52 FPS
- 首帧渲染时间: 0.5 秒内
- 无需 TensorRT 或量化即可实现近线性 FPS 扩展
应用场景涵盖从个人创作者到企业级平台的最先进生成式实时流媒体。
原文链接: https://arxiv.org/abs/2511.07399 | 项目主页: http://streamdiffusionv2.github.io
World Labs Marble: 从 2D 到 3D 世界 🌍
李飞飞的 World Labs 公测了 3D 世界模型 Marble,这是向空间智能迈进的重要一步。
核心功能:
- 从文本、单图、多图、视频、粗 3D 布局生成完整 3D 世界
- 交互式编辑、扩展与组合
- 可导出 Gaussian Splat 等格式
用户可以选择大场景,模型会生成完整的 3D 环境,支持后续编辑和组合。这对于游戏开发、虚拟现实、建筑可视化等领域都有重要意义。
原文链接: https://marble.worldlabs.ai
Meta Omnilingual ASR: 1600 种语言的语音识别 🗣️
Meta AI 发布的全语言自动语音识别系统,支持超过 1600 种语言的语音识别。这是语音识别技术的重大突破,大幅扩展了 AI 语音技术的语言覆盖范围,特别是对于低资源语言的支持。
原文链接: https://ai.meta.com/blog/omnilingual-asr-advancing-automatic-speech-recognition/
Cursor AI 模型排行榜:半年巨变 📈
半年时间,Cursor 的 AI 模型排行榜(最受欢迎和最快增长)出现了翻天覆地的变化,两个榜单完全不重合。
关键发现:
- Claude Sonnet 4.5 仍是最受欢迎的最强编程模型
- 很多开源模型不断靠近它,但还未超越
- AI 模型的发展速度确实经历了翻天覆地的变化
这揭示了 AI 编程领域的快速迭代和激烈竞争。
工具
提示工程 2025 完整路线图 🎓
一份从初学者到专业级别的 12 个月提示工程学习路线图,涵盖核心技术、高级技巧和职业发展。
高级技术:
- 思维链 (CoT): 让 AI 展示推理过程,提高推理和逻辑任务的准确性
- 思维树 (ToT): 探索多个推理路径,然后选择最佳路径
- ReAct: 结合推理与外部操作(如搜索网络、运行代码)
- 自我一致性: 生成多个推理路径并选择最一致答案
- 元提示: 让模型对推理过程进行推理
职业前景:
- 美国平均年薪 $120K-$160K
- 欧洲 €80K-€130K
- 印度 ₹12-25 LPA
根据 Gartner 2025 年 AI 技能报告,超过 40% 的新 AI 相关职位涉及提示设计、评估或编排。提示工程正在从实验性技能转变为标准化的专业能力。
原文链接: https://brollyai.com/prompt-engineering-roadmap/
Claude 提示工程最佳实践 📝
Anthropic 的 Claude 团队提供了官方的提示工程最佳实践指南。
核心技术:
- 明确和清晰: 现代 AI 模型对清晰明确的指令响应特别好
- 提供上下文和动机: 解释为什么某事重要,帮助 AI 更好理解你的目标
- 使用示例: one-shot/few-shot 提示
- 预填充响应: 特别适合结构化格式如 JSON
- 链式提示: 将复杂任务分解为多个步骤
这是一个全面的官方指南,展示了如何从 Claude 获得最佳结果。
原文链接: https://claude.com/blog/best-practices-for-prompt-engineering
MineContext: 情境感知 AI 助手 🔒
MineContext 是火山引擎开源的桌面应用程序,可以从屏幕活动中捕获和处理上下文,提供主动的 AI 辅助。
核心特性:
- 本地优先的数据存储: 所有数据本地存储,强调隐私保护
- 多 LLM 提供商支持: 支持包括本地模型在内的多个 LLM 提供商
- 自动化功能: 生成自动摘要、待办事项和见解
- 模块化架构: 用于上下文捕获、处理和消费
技术栈为 Electron + React + Python,适合需要隐私保护的情境感知 AI 助手场景。
原文链接: https://github.com/volcengine/MineContext
Google ADK-Go 与 Stripe AI 🛠️
Google ADK-Go: AI 开发工具包 Google 开源的 AI 开发工具包 Go 语言版本,简化 AI Agent 的开发流程,提供丰富的 API 和工具来构建智能代理系统。 https://github.com/google/adk-go
Stripe AI: AI 驱动支付产品 Stripe 开源的工具,让 AI 智能体能够安全、高效地调用 Stripe API,实现自动化支付流程。智能体可以通过自然语言指令创建支付链接、处理计费或管理连接账户。
Gaga-1: 首款 AI 演员视频模型 🎭
Gaga-1 正式上线,这是第一款能生成 AI 演员的视频模型,终于支持 9:16 竖屏了。
核心特点:
- 第一款能生成 AI 演员的视频模型
- 支持 9:16 竖屏(适合 TikTok 和抖音)
- 模型限免
用它制作的爆款视频肯定会在短视频平台上出现。
闪电说:免费语音转文字 🎙️
闪电说(前身为"代体")是一个免费的语音转文字工具,使用 GLM4.6 模型,效果最好,几乎感觉不到延迟。
官网也重新设计了,再也不是蓝紫 AI 配色了。
AI World Clocks: 创意实验 🕐
这是一个交互式项目,每分钟使用九个不同的 AI 模型生成模拟时钟可视化。
实验设置:
- 九个不同的 AI 模型
- 相同的提示(2000 token 限制)
- 生成 HTML/CSS 代码
有趣发现: 某些模型表现稳定可靠,而更受欢迎的模型如 GPT-5 在这种限制 token 任务中表现糟糕。这展示了不同 AI 模型如何解释和执行相同的创意编码任务。
原文链接: https://clocks.brianmoore.com
SlopStop: 过滤 AI 生成内容 🚫
Kagi 搜索引擎推出的 AI 生成内容检测功能 SlopStop,旨在帮助用户识别和过滤低质量的 AI 生成内容,提高搜索结果的质量。
随着 AI 生成内容泛滥,这类工具变得越来越重要。
原文链接: https://blog.kagi.com/slopstop
结语
本周是 AIGC 领域重要的一周。Vibe Coding 从玩笑变成年度词汇,不仅是一个术语的胜利,更是开发范式转变的标志。当程序员从"写代码"转变为"指导 AI",当理性让位于感觉,我们正在经历一场编程史上最反直觉的革命。
Claude Skills 和 Agent SDK 为智能体开发提供了系统化方法,Doubao Seed Code 展示了代理优先的新范式,各大公司在 AI 编程工具上的竞争愈发激烈。而智能体能力金字塔的研究提醒我们:即便是最顶级的模型,在常识推理上仍有很长的路要走。
从视频生成到 3D 世界模型,从语音识别到提示工程职业化,AI 技术在多个维度取得突破性进展。但正如研究所揭示的,2025 年或许只是"智能体们终于能够足够连贯地行动"的元年,真正的通用强智能体还需要时间。
技术在快速进步,但我们也需要保持清醒的认知:AI 是倍增器,不是替代品。它让优秀的人变得不可阻挡,也让普通的人更加普通。关键在于如何利用 AI 放大自己的优势,而不是被动地等待 AI 来取代我们。
下周见!
本周刊由 Agili 精心整理,内容筛选自 Hacker News、Claude 官方博客、Daily.dev 等多个信息源。