Agili 的 AIGC 周刊(Y25W49)
本周 OpenAI 发布了专为知识工作设计的 GPT-5.2,Claude Opus 4.5 开启了 Agent 新时代,行业标准 MCP 也迎来了重要里程碑。让我们一起看看这周都有哪些值得关注的动态。
资讯
OpenAI 发布 GPT-5.2:专为专业知识工作设计
OpenAI 于 12 月 11 日发布了 GPT-5.2,这是目前最先进的前沿模型,专为专业知识工作和长时间运行的智能体设计。
在核心评测中,GPT-5.2 展现出惊人的能力:
- GDPval 评测中,GPT-5.2 Thinking 在 70.9% 的比较中击败或持平行业专家,涵盖 44 个职业领域
- SWE-Bench Pro 达到 55.6%,在真实世界软件工程评估中创下新纪录
- AIME 2025 竞赛数学获得 100% 的成绩
- ARC-AGI-1 中,GPT-5.2 Pro 成为首个突破 90% 阈值的模型
OpenAI 提供了三种模型变体:
- GPT-5.2 Instant - 快速、强大的日常工作和学习助手
- GPT-5.2 Thinking - 专为深度工作设计,特别擅长编码、长文档总结和复杂推理
- GPT-5.2 Pro - 最智能和最值得信赖的选项,适用于需要高质量答案的困难问题
API 定价也同步公布:
- GPT-5.2: $1.75/1M 输入 tokens,$14/1M 输出 tokens
- GPT-5.2 Pro: $21/1M 输入 tokens,$168/1M 输出 tokens
ChatGPT 已开始向付费计划用户推出,API 现已向所有开发者开放。
🔗 了解更多
迪士尼与 OpenAI 达成里程碑协议
12 月 11 日,华特迪士尼公司与 OpenAI 达成协议,迪士尼成为 Sora 平台上的首个主要内容授权合作伙伴。
这项协议包含三个核心内容:
- 三年授权协议:Sora 将能够生成用户提示的短视频,涵盖超过 200 个来自 Disney、Marvel、Pixar 和 Star Wars 的动画、面具和生物角色
- 商业合作:Disney 将成为 OpenAI 的主要客户,使用其 API 构建新产品、工具和体验(包括 Disney+)
- 战略投资:Disney 将向 OpenAI 投资 10 亿美元,并获得购买额外股权的认股权证
可用角色包括:Mickey Mouse、Iron Man、Darth Vader、Simba 等粉丝熟悉的面孔。预计 Sora 和 ChatGPT Images 将于 2026 年初开始生成迪士尼多品牌授权角色的粉丝灵感视频。
这次合作标志着传统娱乐巨头与 AI 公司之间的深度融合,为 AI 生成内容的商业化探索提供了新范例。
🔗 了解更多
MCP 捐赠给新成立的 Agentic AI Foundation
Anthropic 于 12 月 9 日宣布将 Model Context Protocol (MCP) 捐赠给 Agentic AI Foundation (AAIF),这是 Linux Foundation 下的定向基金,由 Anthropic、Block 和 OpenAI 联合发起,Google、Microsoft、AWS、Cloudflare 和 Bloomberg 支持。
自发布一年以来,MCP 已经取得显著成就:
- 超过 10,000 个活跃的公共 MCP 服务器
- 被 ChatGPT、Cursor、Gemini、Microsoft Copilot、Visual Studio Code 等主流平台采用
- AWS、Cloudflare、Google Cloud、Microsoft Azure 提供企业级基础设施支持
- Claude 现有超过 75 个连接器(由 MCP 驱动)
- 官方 SDK 月下载量达 97M+(Python 和 TypeScript)
AAIF 的成立意义重大:确保 agentic AI 技术保持透明、协作、符合公共利益。MCP 将加入 Block 的 goose 和 OpenAI 的 AGENTS.md 作为创始项目。
下一届 MCP Dev Summit 将于 2026 年 4 月 2-3 日在纽约举行。
🔗 了解更多
Mistral 发布 Devstral 2 和 Vibe CLI
Mistral 于 12 月 9 日发布 Devstral 2——新一代编码模型家族,包含两个版本:Devstral 2 (123B) 和 Devstral Small 2 (24B)。
核心亮点:
- Devstral 2 在 SWE-bench Verified 上达到 72.2%,是 SOTA 开源代码 agent 模型
- 比 Claude Sonnet 成本效率高 7 倍(在真实任务上)
- Devstral 2 (123B) 比 DeepSeek V3.2 小 5 倍,比 Kimi K2 小 8 倍
- Devstral Small 2 (24B) 达到 68.0%,可在消费级硬件上本地运行
在许可证方面,Devstral 2 采用修改后的 MIT 许可证,Devstral Small 2 采用 Apache 2.0。
同时发布的 Mistral Vibe CLI 是开源命令行编码助手,由 Devstral 驱动,支持文件操作、代码搜索、版本控制、命令执行,可通过 Agent Communication Protocol 集成到 IDE。
定价方面,Devstral 2 目前免费使用,之后 API 定价为 $0.40/$2.00 per million tokens。已与 Kilo Code、Cline 和 Zed 编辑器集成。
🔗 了解更多
n8n 2.0 发布:安全优先的重大升级
n8n 团队于 12 月 8 日宣布发布 2.0 版本,专注于安全性、可靠性和性能的底层重构。
核心改进:
- 安全性:任务运行器默认启用,所有代码节点在隔离环境中执行;环境变量访问默认关闭;任意命令执行默认禁用
- 可靠性:移除遗留选项,修复边缘情况 bug
- 性能:新的 SQLite 池化驱动在基准测试中快达 10 倍;文件系统二进制数据处理更稳定
新功能亮点包括 Publish / Save 分离设计、改进的画布视觉和侧边栏导航、内置迁移报告工具。
自 2023 年 7 月 1.0 发布以来,n8n 取得了令人瞩目的增长:GitHub Stars 从约 30,000 增至 160,000+,社区成员从 6,267 增至 115,192,团队规模从 30 人扩展至 190+。
Beta 版本 (2.0.0) 于 12 月 8 日发布,Stable 版本 (2.0.x) 将于 12 月 15 日发布。版本 1.x 将在 2.0 发布后继续支持 3 个月。
🔗 了解更多
ChatGPT 现可免费使用 Adobe 应用编辑照片和 PDF
Adobe 为 ChatGPT 用户提供了三款应用集成:Photoshop、Acrobat 和 Adobe Express,用户可以通过描述想要的效果来创建设计或调整照片和 PDF。
使用方式非常简单:上传文件并输入应用名称 + 对话式指令。例如:“Adobe Photoshop,帮我模糊这张图片的背景”。在同一对话中无需再次指定应用名称。
功能特点:
- Photoshop 应用:编辑图像特定部分、应用创意效果、调整亮度对比度等
- Acrobat 应用:编辑现有 PDF、压缩和转换文档、提取文本或表格、合并多个文件
- Adobe Express 应用:生成和编辑设计(海报、邀请函、社交媒体图形等)
这些照片、PDF 和设计可以直接在 Adobe 的原生应用中打开继续编辑,实现跨平台协作。
目前全球可用:桌面、网页和 iOS。Android 平台的 Adobe Express 应用已可用,Photoshop 和 Acrobat"即将推出"。
这次集成帮助两项服务抵御来自 Google Gemini AI 的竞争,同时也降低了照片编辑和设计的技能门槛。
🔗 了解更多
通义千问发布 Qwen3-Omni-Flash 升级版
通义千问于 12 月 8 日发布了 Qwen3-Omni-Flash-2025-12-01,这是基于 Qwen3-Omni 的全面升级版本,是一个原生多模态大模型,能够无缝处理文本、图像、音频和视频输入,并同时生成文本和自然语音输出。
核心亮点:
- 大幅增强的音视频交互体验:显著改善音视频指令的理解和执行,有效解决口语化场景中的"智能下降"问题
- 加强的系统提示控制:支持完全自定义系统提示,精确控制模型行为(个性风格、口语偏好、输出长度等)
- 更可靠的多语言遵循:支持 119 种语言的文本交互、19 种语言的语音识别、10 种语言的语音合成
- 更人性化和流畅的语音合成:智能调整语速、停顿和语调
性能提升覆盖多个维度:更强的文本理解与生成(ZebraLogic +5.6、LiveCodeBench-v6 +9.3)、更准确的语音理解(VoiceBench +3.2)、更深入的图像理解(MMMU +4.7)、更连贯的视频理解(MLVU +1.6)。
未来计划包括多说话人 ASR、视频 OCR、音视频主动学习,增强对 agent 工作流和函数调用的支持。
🔗 了解更多
模型
Claude Opus 4.5:AI Agent 时代的里程碑
Mckay Wrigley 在使用 Claude Opus 4.5 两周后认为,这是 AI 发展史上的重要时刻——Opus 4.5 正式开启了 Agent 时代。
核心观点:
- 可靠的 AI 助手:Opus 4.5 就像 Waymo 自动驾驶,告诉它"从 A 到 B",它就能自主完成
- 最佳组合:Opus 4.5 + Claude Agent SDK 是构建实用 Agent 的黄金搭档
- Anthropic 的崛起:年收入增长 10 倍(2023: $1M→$100M, 2024: $100M→$1B, 2025 预计: $1B→$10B)
实用建议:
- 信任模型:把它当作真正的同事,给它更复杂的任务
- 语音输入:用语音随意表达想法,让它整理成完整方案
- 使用 Obsidian vault:与 Opus 4.5 配合效果极佳
Claude Code 使用技巧:
- Claude Code + Opus 4.5 是目前最强的 AI 编程工具
- Plan 模式对复杂任务表现显著更好
- Opus 4.5 是好设计师:虽然不是世界级,但已超越"AI 渣作"
- 尝试伪代码:Opus 4.5 在推断伪代码意图方面令人惊叹
Claude Agent SDK 被评价为"最好的开源秘密":世界上最好的智能体框架。建议开发者深入学习 SDK,了解越多能做的越多,并尝试构建自动化日常工作的实用智能体。
图像能力也得到显著提升,Screenshot-to-code 达到全新水平。
🔗 了解更多
工具
PrivacyFirewall:本地 AI 隐私防火墙
PrivacyFirewall 是一个本地优先的 PII(个人身份信息)和机密信息防火墙,专为 ChatGPT、Claude 和 Gemini 等 AI 工具设计。这个项目在 24 小时内获得 100+ stars,被安全专业人士评价为"解决了一个重大安全问题"。
核心功能:
- 人机交互保护:防止意外泄露
- 100% 本地处理:仅在浏览器和本地主机处理
- 实用保护:正则表达式 + 可选的 Transformer NER
- 友好的用户体验:警告、粘贴拦截模态框、覆盖选项
- 开源可审计:MV3 + FastAPI + Hugging Face 技术栈
两层保护机制:
- Lite 模式(仅正则表达式):在扩展中即时运行,无需设置,快速、离线、默认启用
- AI 模式(可选本地 LLM):使用本地 FastAPI 代理 + Transformer 模型进行更深入的检测
检测覆盖范围包括电子邮件、电话号码、信用卡、MAC/IP 地址、AWS 密钥、JWT tokens、私钥等,以及 PERSON、ORGANIZATION、LOCATION 等命名实体。
最重要的是:没有任何提示或文本离开你的机器,无分析、遥测或外部日志记录。
OpenAI 悄然采用 Skills 机制
Simon Willison 观察到 OpenAI 正在悄然采用 skills 机制,现已在 ChatGPT 和 Codex CLI 中可用。
在 ChatGPT 中,Code Interpreter 功能现在有一个新的 /home/oai/skills 文件夹。只需提示"Create a zip file of /home/oai/skills"即可访问。Skills 涵盖电子表格、docx 和 PDF 处理。对于 PDF 和文档,采用的方法是转换为每页渲染的 PNG,然后通过视觉模型处理。
在 Codex CLI 中,两周前添加了对 skills.md 的实验性支持。任何 ~/.codex/skills 文件夹中的文件夹都将被视为 skill。需要使用 --enable skills 选项运行 Codex。
Simon 使用 Claude Opus 4.5 的技能创作技能创建了一个 Datasette 插件技能,然后在 Codex CLI 中成功使用该技能生成了一个 cowsay Datasette 插件。
这表明 Skills 是一个非常轻量级的规范,但 OpenAI 在 12 月已经大力采用,验证了 Simon 在 10 月的预测"Claude Skills 可能比 MCP 更重要"是正确的。
Simon 建议 Skills 应该被正式记录,这可能是新成立的 Agentic AI Foundation 可以承担的工作。
🔗 了解更多
Andrej Karpathy 用 GPT 评分 10 年前的 HN 讨论
Andrej Karpathy 创建了一个有趣的项目,使用 GPT 5.1 Thinking 自动评分 10 年前的 Hacker News 讨论,以后见之明的视角分析评论的预见性。
项目灵感来自读到 2015 年 12 月的 HN 前台页面时,意识到 LLM 非常适合评估评论的预见性。两个宏观原因:1) 训练未来预测能力是可能且值得的 2) “Be good, future LLMs are watching” - 未来 LLM 会详细审查我们今天的一切。
工作原理:
- 下载指定日期的前台 30 篇文章
- 为每篇文章下载/解析文章本身和完整评论线程
- 打包成 markdown 提示请求分析,包含 6 个部分:摘要、实际发生了什么、最有预见性/最错误的评论、其他有趣方面、个人评分、文章有趣度评分
- 提交到 GPT 5.1 Thinking 进行分析
- 渲染结果为静态 HTML 网页
成果托管在 https://karpathy.ai/hncapsule/,包含 2015 年 12 月的 31 天 × 30 篇文章 = 930 次 LLM 查询,成本约 $58,运行时间约 1 小时。创建了 Hall of Fame 展示最有预见性的评论者。
有趣案例包括 Swift 开源 (2015-12-03)、Figma 发布 (2015-12-06)、OpenAI 原始公告 (2015-12-11)、geohot 构建 Comma (2015-12-16)、SpaceX Orbcomm-2 任务 (2015-12-22)。
MCPorter:TypeScript 调用 MCP 服务器的终极工具
MCPorter 是一个 TypeScript 运行时、CLI 和代码生成工具包,专为 Model Context Protocol (MCP) 设计。
核心特性:
- 零配置发现:自动合并来自 Cursor、Claude、Codex、Windsurf、VS Code 等编辑器的 MCP 配置
- 一键生成 CLI:将任意 MCP 服务器定义转换为可分发的命令行工具
- 类型安全客户端:自动生成 .d.ts 接口和客户端包装器
- 友好的 API:createServerProxy () 暴露驼峰命名方法,自动处理 JSON Schema 默认值
- OAuth 支持:内置 OAuth 缓存,支持 HTTP、SSE 和 stdio 传输协议
快速开始:
# 列出 MCP 服务器
npx mcporter list
# 调用工具
npx mcporter call context7.resolve-library-id libraryName=react
# 生成独立 CLI
npx mcporter generate-cli --command https://mcp.context7.com/mcp
安装方式:npx 即时运行、添加到项目 (pnpm add mcporter)、Homebrew (brew install steipete/tap/mcporter)。
使用场景包括一次性调用 (callOnce ())、多次调用 (createRuntime () + createServerProxy ())、生成独立 CLI、生成类型化客户端等。
Autofix Bot:混合静态分析和 AI 的代码审查 Agent
Autofix Bot 是专为深度代码审查而构建的 AI agent,采用混合架构结合静态分析和 AI 审查,由 DeepSource (YC W20) 开发。
问题背景是 AI 编码 agents 使代码生成几乎免费,但将瓶颈转移到了代码审查。仅静态分析具有固定检查器集合是不够的,而仅 LLM 审查有运行之间不确定、对安全问题的召回率低、大规模成本高昂等限制。
混合架构的三层处理:
- 静态分析阶段:5,000+ 确定性检查器 (代码质量、安全、性能)建立高精度基线
- AI 审查:Agent 以静态发现作为锚点审查代码,可访问 AST、数据流图、控制流、导入图作为工具
- 修复生成:子 agents 生成修复,静态工具在发出 git 补丁之前验证所有编辑
性能表现:
- OpenSSF CVE Benchmark (200+ 真实 JS/TS 漏洞):准确率 81.2%,F1 分数 80.0% (超越 Cursor Bugbot 74.5%, Claude Code 71.5%, CodeRabbit 59.4%)
- 秘密检测:F1 分数 92.8% (超越 Gitleaks 75.6%, detect-secrets 64.1%, TruffleHog 41.2%)
定价为 $8/100K 代码行,从 $10 免费积分开始。
🔗 官网
Browser4:为 AI Agents 设计的高性能浏览器引擎
Browser4 是为 AI Agents 设计的高性能浏览器引擎基础设施层,让 AI 能够感知、交互和在万维网上生存。
核心能力:
- 浏览器 Agents:能够在浏览器中推理、规划和行动的自主 agents
- 浏览器自动化:用于工作流、导航和数据提取的高性能自动化
- 机器学习 Agent:无需消耗 tokens 即可学习复杂页面的字段结构
- 极致性能:完全协程安全;支持每台机器每天 10-20 万次页面访问
为什么选择 Browser4?传统工具 (Playwright、Selenium、Puppeteer)适合人工编写的脚本,但作为 AI agents 的核心执行层时显示出摩擦。Browser4 设计为将 AI agents 作为一等公民的浏览器引擎,基于原生 Chrome DevTools Protocol (CDP) 构建。
技术特性包括问题解决型自主浏览器 agents、并行 agent 会话、LLM 辅助的页面理解、基于工作流的浏览器操作、精确的协程安全控制、一行命令数据提取、X-SQL 扩展查询语言、高效并行页面渲染、抗封锁设计等。
项目采用 Apache-2.0 许可证,使用 Kotlin/JVM 编写,已获得 971+ GitHub Stars。
EdgeVec:浏览器中的亚毫秒级向量搜索
EdgeVec 是一个用 Rust 构建的嵌入式向量数据库,具有一流的 WASM 支持,设计为可在任何地方运行:浏览器、Node.js、移动应用和边缘设备。
核心特性:
- 亚毫秒级搜索:在 100k 向量时 0.23ms (768 维,量化)
- HNSW 索引:O (log n) 近似最近邻搜索
- 标量量化 (SQ8):3.6 倍内存压缩
- WASM 优先:通过 WebAssembly 原生支持浏览器
- 持久化存储:浏览器中使用 IndexedDB,其他地方使用文件系统
- 微小体积:148 KB gzipped (比 500KB 目标小 70%)
性能表现 (Alpha 版本):
- 10k 向量:88 µs (量化) - 比目标快 11 倍
- 50k 向量:167 µs (量化) - 比目标快 6 倍
- 100k 向量:329 µs (量化) - 比目标快 3 倍
核心优势包括唯一的 WASM 解决方案在 100k 向量时搜索 <1ms、零网络延迟 (100% 本地运行)、保护隐私 (数据不离开设备)、微小体积 (148 KB gzipped)。
使用场景包括具有语义搜索的浏览器扩展、本地优先应用、保护隐私的 RAG、边缘设备上的向量搜索。
Claude Diary:让 AI 代理从经验中学习
Lance Martin 创建了 Claude Diary 插件,让 Claude Code 具备了从经验中学习并更新自身记忆的能力。
基于 CoALA 论文的 Agent Memory 框架,Claude Diary 实现了程序性记忆 (如提示指令)和情景记忆 (如过去的行动)。采用 Generative Agents 论文中的反思式学习方法,代理使用反思步骤将过去的行动综合为通用规则,用于未来的规划和决策。
工作流程:
- 创建日记条目:使用 /diary 命令或自动通过 PreCompact hook
- 执行反思:使用 /reflect 命令分析日记条目
- 更新记忆:自动更新 CLAUDE.md 文件
日记内容捕获完成的工作、设计决策、挑战、用户偏好、PR 反馈。反思内容包括分析日记条目、检查 CLAUDE.md 规则违规、强化弱规则、识别跨条目的重复模式。
实际应用案例包括 PR 审查反馈、Git 工作流、测试实践、代码质量、自我纠正等。PR 评论是更新 Claude Code 记忆的绝佳反馈来源,擅长捕获原子提交、分支命名约定、提交消息格式等显性偏好。
Beyond Vibe Coding:AI 辅助开发完整指南
Google 工程负责人 Addy Osmani 发布了一份全面的 AI 辅助开发指南,帮助开发者从"氛围编程"迈向生产级工程实践。
核心观点是"70% 问题":AI 能快速完成 70% 的功能原型,但剩余 30% 需要深厚的工程知识。AI 开发光谱包括自动补全 → 聊天机器人 → 智能代理。
关键最佳实践:
- 先规划,后编码:让 AI 先提供架构方案,而非直接生成代码
- 上下文为王:提供相关代码、设计文档、错误信息
- 视觉辅助:截图胜过千言万语
- 每次改动后测试:小步快跑,避免调试噩梦
- 清晰描述意图:说明你想实现什么,而非仅描述表面症状
进阶技巧包括提示工程 (分解复杂任务、提供输入输出示例、善用角色扮演)、上下文工程 (像操作系统管理内存一样动态组装信息)、CLI 代理、多代理协作等。
生产就绪原则强调始终审查 AI 生成的代码——像审查初级开发者的代码一样,安全第一 (输入验证、凭证管理、SQL 注入防护)。
Context Engineering 核心原则包括精确和具体、动态信息组装、像操作系统一样思考 (AI 是 CPU,上下文窗口是 RAM)。
🔗 完整指南
宝玉的提示词写作经验分享
宝玉在沉迷于 nano banana pro 画图后,总结了一些提示词写作经验。
核心观点:
- 提示词是手段不是目的:最重要的是你的想法,提示词只是实现想法的手段
- 从大白话开始:大部分时候不需要多么复杂的技巧,先大白话发过去看看效果
写提示词的过程是不停的变换思路不停的"抽卡"重试。你可以不知道怎么调整,但至少得知道什么是好的。当偶尔"抽卡"到一张好的,基于那张好的不停的微调,直到可以稳定的生成。
让 AI 帮你写提示词:把提示词 (有时还会把生成的图片结果一起)发给 AI,让 AI 优化。最好不要只是让它优化,而是给个方向。同时问 Gemini、ChatGPT (GPT-4.5、GPT-5.1),每个模型擅长的不一样。
提示词模板化:把成功的提示词变成模板,让场景可以变化。设定好"变量",哪些是固定不变的,哪些是可以变换的。变量也不用局限一个,可以有多个。
实用建议包括反复测试直到有一个稳定的效果,如果不稳定就多"抽卡",模型也很重要,真不行就等一段时间再重新试试。
提示工程定义:提示词工程是一个过程,系统化地设计、测试、优化提示词的过程。
🔗 了解更多
Manus 团队的上下文工程实战经验
Manus 团队在构建 AI 代理过程中,经历了四次框架重建,总结出六条关键原则。
1. 围绕 KV 缓存设计:KV 缓存命中率是最关键指标,直接影响延迟和成本 (10 倍差距)。实践要点包括保持提示前缀稳定、使用只追加式上下文、确定性序列化 JSON、明确标记缓存断点。成本对比:缓存的输入 $0.30 vs 未缓存 $3.00 /百万 token。
2. 遮蔽而非移除工具:动态增删工具会破坏 KV 缓存并导致模型困惑。使用状态机掩蔽 token logits,通过响应预填充约束动作空间。
3. 文件系统作为上下文:面对 128K token 限制,将文件系统视为无限外部记忆。代理学会按需读写文件,压缩策略保持可恢复性。
4. 通过复述操控注意力:创建并持续更新 todo.md 文件,勾选已完成项目,将全局计划推入模型近期注意力范围。使用自然语言来使注意力偏向任务目标。
5. 保留错误内容:将失败尝试保留在上下文中,让模型看到错误和堆栈跟踪。隐式更新内部信念,降低重复错误概率。错误恢复能力是真正代理行为的核心指标。
6. 避免少样本示例陷阱:重复的行动-观察对会让模型陷入固定模式。通过引入结构化变化增加多样性:不同模板、替代性措辞、格式噪音。
结论:上下文工程决定代理的速度 (KV 缓存命中率)、恢复能力 (错误处理能力)、扩展范围 (文件系统作为记忆)。
🔗 了解更多
GPULlama3.java:纯 Java 中的 GPU 加速推理
在纯 Java 中使用 TornadoVM 进行 GPU 加速的 Llama3.java 推理,目前支持 Llama3、Mistral、Qwen2.5、Qwen3 和 Phi3 模型。
核心特性:
- 纯 Java 实现:使用原生 Java 编写的 Llama3 模型
- GPU 自动加速:通过 TornadoVM 自动在 GPU 上加速
- 跨平台支持:NVIDIA GPUs (OpenCL & PTX)、Intel GPUs (OpenCL)、Apple GPUs (OpenCL)
- 企业集成:在 Quarkus 和 LangChain4J 中用作 GPU 推理引擎
自 LangChain4j v1.7.1 起,GPULlama3.java 被正式支持为模型提供商,可以在 LangChain4j 应用程序中直接使用,无需额外的粘合代码。
性能表现 (FP16 模型):
- NVIDIA RTX 5090:Llama-3.2-1B 117.65 tokens/s, 3B 112.68 tokens/s
- NVIDIA RTX 4090:Llama-3.2-1B 86.11 tokens/s, 3B 75.32 tokens/s
- Apple M4 Pro:Llama-3.2-1B 16.77 tokens/s, 3B 8.56 tokens/s
这是首个 Java 原生实现的 Llama3,通过 TornadoVM 自动编译并在 GPU 上执行 Java 代码,为 JVM 添加了诸如 GPU 加速、Vector 加速、高性能访问堆外内存等功能。
GenTabs:将浏览器标签转换为自定义应用
Google Labs 发布了实验性功能 GenTabs,这是一个 AI 驱动的工具,可以将打开的浏览器标签转换为自定义的交互式应用程序。
核心功能:
- 上下文感知生成:GenTabs 分析你当前打开的特定标签
- 目标导向:根据你陈述的目标创建定制应用
- 无限可能:没有固定模板,根据需求生成独特应用
- 交互式界面:生成的应用是完全交互式的,而非静态视图
示例用例包括探索太阳系、计划旅行、创建膳食计划、规划花园等。
GenTabs 目前是 Disco 实验的一部分,用户可以加入候补名单获取访问权限。代表 Google 在 AI 增强网页浏览和生产力方面的持续探索。
🔗 了解更多
Claude Code Skills 自动激活的解决方案
Scott Spence 发现 Claude Code 的 Skills 功能并不会像官方声称的那样"自主激活",并提供了解决方案。
问题根源是 Skills 号称是"自主激活"的,只要请求匹配技能描述,Claude 就会自动使用。实际上 Claude 太过专注于完成任务,会直接跳过检查可用工具的步骤。
解决方案是用 Hook 强制激活。核心思路:不要依赖"自主激活",而是通过 UserPromptSubmit Hook 检测触发词,显式命令 Claude 使用技能。创建 ~/.claude/hooks/auto-research.sh 脚本检测关键词,更新 ~/.claude/settings.json 添加 Hook 配置。
关键差异:
- 温柔提醒 (无效):“💡 Check .claude/skills/ for relevant skills”
- 显式指令 (有效):“🔍 INSTRUCTION: Use Skill (research) to handle this request”
更简洁的通用方案是一条通用 Hook 指令适用于所有技能。实测结果:20 次测试,成功率约 50%——基本靠运气。但比维护复杂脚本省心多了。
结论:官方说 Skills 会自动激活,实际不会。用简单 Hook 碰碰运气,重要任务还是显式调用 Skill (skill-name) 最靠谱。
🔗 了解更多
结束语
这一周 AI 领域的进展令人振奋:从 GPT-5.2 的全面升级到 Claude Opus 4.5 开启的 Agent 新时代,从迪士尼与 Sora 的里程碑合作到 MCP 生态的进一步成熟,AI 正在快速融入我们的工作和生活。
特别值得关注的是上下文工程和 Agent 架构的实践经验分享,这些真实的工程经验为我们构建可靠的 AI 应用提供了宝贵的指导。
下周见!