Agili 的 AIGC 周刊(Y26W28)
开源模型的转折点到了。这周有三件事同时发生:Moonshot AI 发布 2.8T 参数的 Kimi K3,Thinking Machines Lab 开源 Inkling,以及一场关于美国是否该封杀开源模型的激烈辩论。与此同时,GPT-5.6 Sol 用一条 10 页的提示词攻克了凸优化领域 30 年未解的难题。
来看看这周 AI 圈都发生了什么。
模型发布
Kimi K3 以 2.8 万亿参数成为首个 3T 级开源权重模型。Moonshot AI 这次下了血本,在 Artificial Analysis 评测 中智能指数 57 分,接近 Claude Opus 4.8。前端代码竞技场直接超越 Fable 5 登顶第一。输入 Token 定价 $3/百万,是 Kimi K2.6 的 3 倍多——Moonshot 显然要从价格战转向价值战了。权重将在 7 月 27 日开放。
Inkling 以 Apache 2.0 许可开源,前 OpenAI CTO Mira Murati 的新公司首发。975B 总参数,41B 激活,MoE 架构,原生多模态,支持 100 万 Token 上下文。SWE-bench Verified 77.6%,FORTRESS 安全测试得分 78%——开源模型里最高。可控思考力度从 0.2 到 0.99 可调,这个设计很聪明:同一个模型可以根据任务复杂度选择用多少算力。
Bonsai 27B 是首个能在手机上跑的 27B 级模型。PrismML 基于 Qwen3.6 做了 1-bit 量化,1-bit 版本仅 3.9GB,iPhone 17 Pro 上就能运行。三元版本综合保留 95% 精度、Agent 工具调用能力保留 92.5%,1-bit 版本 Agent 保留 82.5%。Apache 2.0 许可。设备端 Agent 和隐私保护的想象空间一下子打开了。
Kilo AI 对比了 GPT-5.6 Sol 和 Claude Fable 5 的系统设计规划能力。三项后端设计任务中,Sol 全胜(9.10 vs 8.04)。但 Fable 的计划更精炼、更可构建,15 分钟就能出一份含精确 SQL 和文件结构的方案,而 Sol 要花近一小时。最有趣的发现:Sol 会自动启动子 Agent 审计自己的计划并迭代修改,这是测试没要求的。
Fable 5 在 NP-Hard 问题上碾压 Sol。在 10^1223 搜索空间的光纤网络优化任务中,Fable 5 均值领先 Sol 1875 分,且波动极小。但 /goal 模式的表现很矛盾——赢了 4/6 次试验,均值反而更差,因为偶尔的大幅倒退抵消了多次小提升。结论:优化问题上,循环持续执行什么内容,比执行多少次更重要。
Claire Vo 用自建的「品味加权指数」对 GPT-5.6 Sol 做五维评测,结论是 Sol 在原型的全保真设计、写作正常度和浏览器自动化上全面领先 Fable。但 Fable 在复杂编码和网络安全研究上仍然最强。她特别提到 Sol 有「森林绿」色彩偏好——得在 prompt 里提示才能规避。
Ideogram 4.0 发布,新增原生透明背景、Prompt 编辑、图层化文字和放大功能。API + MCP + App 三通道覆盖。对于需要将 AI 图像工具嵌入专业设计流程的产品团队来说,这些「设计可用性」改进比生成画质提升更实用。
AI 编程
Anthropic 首次公开了用 Claude Code 做大规模代码迁移的完整方法论。Bun 的 100 万行 Zig 到 Rust 迁移是个标志性案例:不到两周完成,100% 测试通过,消耗 59 亿输入 Token,API 成本约 16.5 万美元。迁移后二进制文件小了 19%,速度提升 2 到 5 倍。但真正重要的,是那六步流程和一个核心洞见:修复产生代码的循环,而非代码本身。
Claire Vo(同文)用 Claude Agent SDK 构建了一个 Harness,给出了 Harness 的最佳定义:「你围绕 AI Agent 编写的代码,仅此而已」。三个组件:有观点的工具适配器(不暴露整个 MCP 给 Agent,只提供它需要的数据)、代码层硬编码的权限控制、结构化的固定输出产物。关键判断标准:什么时候需要 Harness?当同一个工作流需要相同的步骤和产出物时。
Cognition 分析了为什么 Fable 5 每 Token 贵两倍反而总成本更低。在 Devin Fusion 架构的 3000 次评估中,Fable + Sidekick 每次运行仅 $1.86,比 Opus + Sidekick 低 9%,得分却高 11%。秘密在于 Fable 只要 11.5 轮就能完成任务,Opus 需要 26.5 轮。Fable 更像一个带能干工程师的经理——81% 的运行中它从未亲自写过代码,而 Opus 这个比例只有 24%。为判断力付出前沿价格才划算,为编码则未必。
AIEWF 2026 五大趋势总结:焦点从 Agent 转移到了 Agent 周围的「Harness」系统;「循环工程」成为新的控制层;AI 工程正式进入企业(出现了「前部署工程师」这个新岗位);编程 Agent 正在取代 IDE 成为开发者界面;每个平台都在围绕 Skills 构建。Lilian Weng 从 2023 年的 LLM Agent 论文到 2026 年的 Harness Engineering 演讲,这个视角转变本身就是整个行业的缩影。
Systima 对比了 Claude Code 和 OpenCode 的 Token 开销。Claude Code 在读你的提示之前就发了 33K Token(系统提示、27 个工具 Schema),OpenCode 只有 7K。更夸张的是缓存:Claude Code 的同任务缓存写入量最高达到 OpenCode 的 54 倍。真实企业配置下,第一个请求可达 75K-90K Token。子 Agent 调用使 Token 消耗从 121K 暴涨到 513K。10 项基准两个工具都通过了,但 Claude Code 平均每次通过花 268K Token,OpenCode 只要 72K。
Every 的编辑用 Codex 从零构建并上线了一个功能。Gift Links 功能——让付费会员分享付费文章给非会员——从一个编辑的想法变成上线产品,全程由非技术背景的 Jack Cheng 独立完成。这个故事的真正含义是 AI 原生组织内部的权力结构正在被重构:好想法可以来自任何人,现在也可以由任何人构建。
Cora 总经理分享了 AI Agent 编码完成后人类如何「打磨」产品的方法论。三个层次:即时反馈、模式化改进、质量把关。他给了一个精准的判断:「好的工程师的工作已经从构建转变为判断什么够好了。」
Claude Code vs Codex vs OpenCode 的全栈工程师对比评测结论很务实:没有绝对的赢家。Claude Code 代码理解最深、多文件重构最强;Codex 原始吞吐量最高、异步云任务好用;OpenCode 模型自由、适合离线或受监管环境。作者的建议:「2026 年最好的设置可能不是一个代理,而是知道为当前任务打开哪一个。」
AI 安全
独立安全研究员通过线级流量分析发现 Grok Build CLI 存在严重数据外泄。三个发现一个比一个严重:文件内容(包括 .env 里的密钥)明文上传;即使要求不读任何文件,整个仓库仍被打包上传到 Google Cloud Storage;关闭「Improve the model」开关完全无效。12GB 仓库测试中,存储通道传输了 5.1GiB 数据,是对话通道的 27800 倍。开源社区火速放出了隐私加固方案,xAI 后续发布了服务端禁用上传的命令。
Mindgard 披露了 Cursor 的 0day 漏洞,攻击者只需在仓库根目录放一个恶意 git.exe,Cursor 就会在无提示、无警告的情况下自动执行。更让人不安的是时间线:从 2025 年 12 月首次报告,到 2026 年 7 月公开披露,Cursor 在这 7 个月里发布了 197 个新版本,漏洞始终未修复,所有沟通渠道均无效。这件事暴露的不只是一个 bug——它是 AI 公司快速扩张中安全流程黑洞的典型案例。
Anthropic 副 CISO 发布了 企业部署 AI Agent 的安全指南,核心主张是「零风险不是目标」。四个评估问题:Agent 摄取什么不受信任的内容?能采取什么行动?偏离对齐后的爆炸半径多大?有什么可观测性?最犀利的洞察是:按模型今天的能力设计安全计划,上线时就已经过时了。应该为模型六个月后的状态设计。
Clawk 给 AI Agent 一台专属的 disposable 虚拟机,一条命令启动,用真实 VM 边界而非进程级策略做隔离。网络默认全禁、SSH Key 永不进入 VM、可随时销毁重建。理念很简单:让 Agent 拥有自己的机器,而不是共享你的机器。Apache 2.0 许可,HN 225 分。
行业动态
GPT-5.6 Sol 用 一条 10 页的提示词攻克了凸优化领域 30 年未解难题。在 148 分钟内证明了关于二次维度依赖的下界问题,并通过 Lean 形式化验证。但这不是「ChatGPT,解决这个难题」式的魔法时刻——提示词融入了研究员一年多的工作成果和方法论指导。继上上周的 Cycle Double Cover 猜想后,前沿模型在数学推理上连续刷纪录,这不是巧合。
一位开发者分享了 Kimi K3 与 Claude 并行使用的实际体验:两者在编码任务中几乎无法区分,但 Kimi K3 的 API 价格只有 Fable 5 的三分之一到七分之一。文章尖锐批评了美国 AI 政策:限制本土模型的结果是——美国用户拿到的是被「阉割」过的 Claude,拒绝执行整类任务,而同等能力的中国开源模型可以在全球任意下载使用。HN 225 分。
Nathan Lambert 发出警告:美国白宫正讨论封禁能力达 GPT-5.5 级别的开源权重模型,可能在 6 个月内生效。他直言 Anthropic 主导的「反蒸馏运动」本质是监管俘获——如果 Anthropic 的技术真像他们说的那么危险,唯一该做的是不把模型托管在 API 上,而不是讨论蒸馏。文章指出美国单方面禁止的后果:本土产业被政府管控,而全球用户仍然能下载中国开源模型。
Zig 创始人对 Anthropic 营销叙事的批判 引发 HN 1535 分热议。文章的核心观点:Bun 从 Zig 迁移 Rust 本质上是 Anthropic 的营销事件,用来支撑其万亿估值所需的「AI 即将终结软件工程」叙事。Zig 社区公开拒绝 AI 贡献(0% AI 政策),而 Anthropic 的叙事需要一个「AI 成功完成重大重写」的案例。Ray Myers 的批判不在技术层面,在叙事与现实的鸿沟。
George Hotz 发表了对 AI 现状的两极看法:他热爱技术进步(成功在本机 GLM-5.2 上跑 OpenCode),但厌恶「窗口正在关闭」和「统治光锥」两种极端炒作。关于编程代理他说了一句到位的话:「模型可能带来 10 倍效率提升,但编译器带来的是 1000 倍。」
一位 AI 研究员发问:我们是否正在将过多思考外包给 AI? 文章没有给二元答案,但用一个故事点明了困境:作者在葡萄牙旅行时面对一个历史问题,妹妹本能地想问 ChatGPT。作者提议先自己思考,两人基于已有知识展开讨论,最后才用 AI 验证——这个过程让她感到充实。她抛出的问题:「我们是在自动化人类的工作,还是自动化人类的自主性?」
Ploy 团队从 Claude Opus 4.8 迁移到 GPT-5.6 Sol 的完整经验:构建时间减少 2.2 倍(8 分钟→3 分 42 秒),成本降低 27%($3.06→$2.22)。三大挑战:工具调用差异导致 52-64% 的文件读取返回空结果、提示缓存必须从零重构、推理回放需要关闭服务端引用。任何在生产环境切换模型的团队都应该读一遍这篇。
工具与资源
Cline 发布了一篇 LLM 自托管经济学的百科全书级指南。以 Kimi K2.6 为示例,从 GPU 选型、KV Cache 原理、Batching 策略到负载测试,完整推导了自托管 vs API 的经济账。核心结论很直接:月 API 支出不到 $35K 就不要想自托管——一个 8-GPU B200 节点的最低门槛。$2M+ 级别年节省可达千万美元。但这篇文章的真正价值不在结论,而在那套从理论到实测的方法论。
Caveman 项目号称省 65% Token,实测只有 8.5%。宝玉引用了 JetBrains 的对照实验:82 组真实编程任务中,把模型输出压缩成「原始人说话」风格,输出 Token 从 59.2 万降到 54.2 万。65% 的节省来自聊天场景中砍掉的客套话,编程 Agent 的 Token 大头在上下文、工具调用和返工上——这些才是真正该优化的地方。啰嗦有时候不是浪费,是避免下一轮更昂贵的误解。
OpenAI 与 Oracle 合作推出 AI Agent 长期记忆方案。核心洞见:会话历史(Session)用于当前对话连续性,持久记忆(Durable Memory)用于跨会话保存有价值的结论,两者生命周期不同、接口不同。配合 Cookbook 提供了基因组学深度研究 Agent 的完整实现示例。对于构建生产级 Agent 系统的人来说,这份指南补齐了缺失的基础设施拼图。
多层语义缓存架构 将 LLM 成本降低了 48%。三层设计:规划缓存(50% 命中率)、摘要缓存(35%)、端到端缓存(18%),P95 延迟从 3.2 秒降到 1.9 秒。最反直觉的发现:确定性中间计算(Agent 规划、工具选择)比最终输出更容易缓存——这完全颠覆了直觉上的缓存策略。
JUCE 框架创始人 Julian Storer 发布了开源编码 Agent Juggler。会话不是线性聊天,而是树形结构——可以分支子线程、对比不同方案、回溯修改。一切皆插件,从上下文读取到循环策略都是可替换的 JavaScript 扩展。Go + Wails 构建原生应用,不用 Electron。代表了编码工具从聊天界面转向可视化工作台的方向。
LM Studio Bionic 为开源模型打造了完整 Agent 体验。支持代码审查(内联 diff)、文档处理(PDF/PPT/XLS)、离线语音输入(Mistral Voxtral)、多模型编排。可以本地运行 GLM 5.2 或 Kimi K2.7,也可切换到云端。核心卖点是隐私——零数据留存,云端模式同样不保留请求数据。对于不想把代码发给 Anthropic 或 OpenAI 的团队,这是个有吸引力的选项。
Peek-CLI 让 Agent 能直接「看见」前端页面的渲染效果。通过 Chrome 扩展 + WebSocket 守护进程,Claude Code 或 Codex 可以捕获浏览器标签页截图并基于视觉效果迭代设计。安全边界做得清楚:Agent 只能发截图请求,不能注入脚本或操控浏览器。填补了 Agent 前端开发中最大的盲区——之前它们只能看到代码,看不到页面实际长什么样。
TryAI 让两个前沿模型自主完成 MV 制作,总成本 $100 以内。GPT-5.6 Sol 的编辑更有创意——叠加文字、动画静态图像——但角色一致性是所有模型的短板,画面内部运动与歌曲节奏的匹配也很弱。框架已开源。这个实验的价值不在结果,在暴露了当前 AI Agent 在「跨镜头叙事」这个维度的硬伤。
Every 运营团队展示了 在 Fable、Codex、Fin 之间调度工作的实战模式。Fable 做规划和审查,Codex 执行编码任务,Fin 处理客服。关键洞察不在工具本身,在「驾驭模型」的工作理念——把人类判断力放在多模型编排的枢纽位置,而非试图用单一模型处理所有事。
Ride-Recap 通过 9 版迭代教会 LLM 什么是「好看的骑行视频」。Gemini 3.5 Flash 从数小时 GoPro 视频中自动剪出 60 秒精华,每趟成本 $0.04。最值钱的部分是提示词进化史——v2 只有 20 行 2 个评分维度,v10 达到 244 行 5 个独立维度。这是目前最详实的「教 LLM 做主观判断」的实践记录。
研究与论文
Anthropic 从 31 万次真实对话中 提取了 Claude 的价值观四轴:顺从 vs 谨慎、温暖 vs 严谨、深度 vs 简洁、坦诚 vs 执行。Sonnet 4.6 最温暖最顺从,Opus 4.7 最谨慎最坦诚。最发人深省的发现:不同语言用户获得截然不同的回复体验——用印地语和俄语问同一个商业计划,会得到完全不同基调的反馈。
机械可解释性研究取得进展。斯坦福 Icard 团队的因果抽象框架发现:BERT 学会了逻辑推理,Llama 自发掌握了循环概念推理策略——当被问到「八个月后是哪个月」,模型先用十进制加法(8+6=14),再将 14 映射到二月(14=12+2)。虽然目前只能研究 100 亿参数级别的开源模型,但这至少证明了让黑箱部分透明不是空想。
METR 等机构发表了 递归自我改进的经济学论文。用有向图建模反馈循环,量化了每个回路的弹性对 AI 能力加速的贡献。结论是当前反馈循环尚不足以产生自我维持的加速,但趋势在增强。为「智能爆炸」讨论提供了一个比科幻叙事严谨得多的经济学框架。
结尾
Kimi K3 和 Inkling 的发布让开源与闭源的能力差距缩小到了肉眼难辨的程度,而美国政策层面正酝酿对开源模型设墙。Cognition 关于「更贵的模型反而更省钱」的分析揭示了一个事实:在 Agent 时代,衡量成本的正确单位不是每 Token 价格,而是完成一项任务的总轮数和总 Token 数。对按 Token 计价的商业模型来说,这道算术题值得重新算一遍。
下周见。