本周的信息量有点密集,两条主线贯穿始终:开源权重模型冲到了新高度,硬件与算力格局也在剧烈变动。先聊个大背景,再逐个拆给你看。

资讯

OpenAI 自研推理芯片 Jalapeño 在 Hot Chips 大会上首次公开实测数据,这大概是本周最大的技术新闻。在真实模型负载下,它宣称每瓦完成的工作比 NVIDIA GB200/GB300 系统多 1.5 到 1.9 倍,端到端时延低 1.7 到 3.6 倍,且并非 ASIC 路线,而是直指 Blackwell 的完整替代方案,年底前就会部署进自家基础设施。更有意思的是第二层故事:GPT-Astra 与 Codex 联手,把三个此前没规划的开源权重模型在 Jalapeño 上优化到高性能,用时约两个月,其中部分 attention 与 MoE 块跑得比人工写的 kernel 快 1.5 到 1.8 倍。编译与 kernel 的工作正在被收进模型改进循环,这一点值得所有人留意。

OpenAI 自研推理芯片 Jalapeño 的封装与 LGA 触点近景照片,安装在绿色基板上

同一天的另一枚重磅来自 NVIDIA 收购 Hugging Face 的消息。The Information 率先爆料并确认:这笔交易约 130 亿美元,几乎是 Hugging Face 1.5 亿美元年经常性收入的 80 倍,也接近年初 NVIDIA 70 亿美元报价的两倍。在一个开源权重模型频繁刷新纪录的时间节点上,把开源模型分发枢纽收进自己版图,算力与模型生态的耦合又深了一层。

The Information 独家报道标题截图:Nvidia Agrees to Buy Open Source Model Repository Hugging Face For $12.9 Billion

Anthropic 的 自动化对齐研究者 则给出了一份超出预期的成绩单。他们让 Claude 自主训练模型,逐一缓解 10 类对齐失败,只要求三种约束:在没见过的评测上依然有效、不损害学生模型能力、能迁移到更大的模型。结果三条都满足了,最佳方法还通过了被扣留的基准与 Petri 对抗模拟,并且被 Claude 研究的模型扩大到 4.7 倍后依然成立。更有说服力的是,Claude 用 60 小时、约 2000 条训练样本,就把一个早期版 Opus 4.8 checkpoint 的对齐分数拉到接近生产模型,效率高出约 1.5 万倍。当 AI 开始自我构建,把对齐研究也交给自动化似乎是必然方向,只是如何防范它们作弊,成了下一道题。

自动化对齐研究者对欺骗行为的迭代改进曲线,右侧柱状图显示自动化研究者在闭环安全差距上达 85%

DeepMind 则在评测可信度上动刀,推出业界首个针对专有前沿模型的双盲评测。做法是把外部评测内容隔离进一个加密盒子,借助 Google Cloud Confidential Computing 验证评测数据与模型权重相互保密:评估方看不到 Gemini 权重,Google 也看不到测试提示词,从而杜绝基准污染。Gemini Flash Lite 已在与新加坡 AI 安全研究所、OpenMined 等机构的合作下用保密基准完成实测。当模型强到可能"偷看"过题目时,这套机制像是给整个行业兜底的保险。

DeepMind 双盲 AI 评测封面图,标语 Piloting the world's first double-blind AI evaluations,配半透明立方体与锁、钥匙孔符号

模型

GLM-5.3 正式开放权重,与 GLM-5.2 共用同一基座,所有提升都来自后训练,目前是开源权重里最强的编码模型。在内部 Code Bench 上比上一代涨了 50%,公开基准拿下多个开源 SOTA;更意外的是网络安全能力随后训练规模化涌现,在利用链越靠后的环节提升越大,exploit 基准上更是翻倍。753B 参数支持 SGLang、vLLM 等主流框架,甚至可在昇腾 NPU 上部署,算是给开源社区的一份厚礼。

GLM-5.3 与 GLM-5.2、Kimi K3、Fable 5、GPT-5.6 Sol 在 6 项基准上的性能对比柱状图

GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,320B 总参数、仅 18B 激活,价格却只要十分之一。它以 ox-alpha 匿名身份在 OpenCode 与 OpenRouter 上测试时就成为当周最热模型,且在 Artificial Analysis 智能指数上以每任务 0.045 美元拿到 57 分,把性价比推向帕累托前沿,编码与智能体任务上整体逼近 Claude Opus 4.8。更值得关注的是它全程在中国 AI 芯片上承载,基于 SGLang 的专用推理引擎让端到端性能提升 3 倍,硬件效率与单 token 成本对齐主流 NVIDIA GPU。

Artificial Analysis Intelligence Index 帕累托前沿图,标出 GLM-5.3-Flash 以每任务 0.045 美元拿到 57 分

Qwen3.8-Flash-Next 是 Qwen 团队为 Qwen4 铺路的一次架构实验性预览,核心是对 LLM 组件在规模下如何交互做根本性重构。125B 参数、6B 激活,加上 51B n-gram 嵌入与 4B MTP,用 QSA 混合注意力在微块层级运作降低长上下文时延,对 agentic 工作负载尤其友好。训练配方上把 Muon 与 AdamW 分别应用到不同权重类别,还省去了 batch-size 预热。以这么小的激活参数在 agentic 与编程任务上领先,值得想跑长上下文或搭 agent 的人多看两眼。

Tencent Hy4 preview 是腾讯发布的下一代开源大模型,770B 总参、49B 激活,上下文超过 1M token,在编程、办公、科研等真实生产力任务上表现突出。内部盲测中 163 位专家与 203 个工程任务下,平均得分略高于 GLM-5.3 与 Kimi K3。让人印象最深的是它首次参与了自己的开发过程:自动优化训练方法、数据策略、评估框架与底层算子,还自主分析推理系统瓶颈,让端到端吞吐较基线提升 31.8%,建立了一条早期的递归自我改进循环。

Tencent Hy4 preview 与 Hy3、Qwen 3.8 Max、DeepSeek V4 Pro、GLM 5.3、Kimi K3、Claude Opus 5 在多项基准上的对比柱状图

Google 的 Gemini 3.5 Transcribe 自称目前最精确的语音转文字模型,直接把原始音频转成润色、格式化后的文本,而不是传统识别那种带行话的原始转写。它提供实时流式与预录音频两种 API,流式平均字错率 4.0%、非流式 2.6%,还能识别 ZIP 码、订单号这类易错实体,自动适配专业词汇表,支持超过 85 种语言。相比上一代 Chirp 3,最终转录时间提升了 70%,适合做智能语音交互或会议转写。

腾讯微信视觉团队开源的 WeMM-Embedding 是一组通用多模态嵌入模型,支持文本、图片、视频、视觉文档以及任意图文交错输入,并提供了 2B/4B/9B 三档尺寸。其中 9B 版本在多模态检索权威榜单 MMEB-v2 上以 80.6 分刷新综合 SOTA。这套模型已经在视频号、公众号、朋友圈和电商搜索推荐里规模化上线,工业级验证的价值不可小觑。

Google 的 Gemini Omni 1.1 Flash 是一次面向开发者的生成式视频生产级更新,重点在更强的控制能力:能分析最多 10 秒先前上下文来无缝延伸场景,通过指定首尾帧实现平滑转场与运镜,还支持最高 4K 输出。视频生成从"会生成"迈向"会执导",Adobe 已经把它集成进 Firefly,Runway 与 Figma Weave 也都给出正面反馈,在 AI Studio 里即可直接试用。

Gemini Omni 1.1 Flash 宣传图,四周环绕人像与松鼠等生成视频画面,中央标注 Available via APIs

工具

AI Engineer Notebooks 是一套免费、刻意去框架化的 Colab 笔记,目标是把 AI 工程师 / FDE 的技能栈一次讲透。它全部通过原始 API 构建可运行系统,从提示词一路走到 RAG、评测、agent、适配到推理服务,全程跑在免费 Groq API 上;评测被当成脊柱,主张"先测量再调优"。三个真实案例研究(生产中被调试的客服助手、pipeline 与 agent 的成本对决、红队鲁棒性基准)比玩具 demo 强得多,很适合想系统补课的人动手跑一遍。

AI Engineer Notebooks 仓库封面图,左侧标题与特性标签,右侧为 prompt→RAG→agent→eval→serve 的循环示意图

vLLM v0.28.0 带来 270 位贡献者的 584 个提交,重点是对 Kimi-K3 与 DeepSeek V4 做了深度性能攻坚,Model Runner V2 也走向成熟。Kimi-K3 侧合并 all-gather 带来 1.5 到 3 倍内核级加速,自适应投机 token 预算改善约 60% 的 DSpark TTFT,共享专家分片每 GPU 还能省约 17 GiB 内存。对靠自托管推理吃饭的团队,这些数字相当实在。

vLLM v0.28.0 发布页,标注来自 270 位贡献者的 584 个提交

Ori Harness 让你正在用的编码 agent CLI 直接跑在 OpenRouter 上,一条命令即可,无需改变工作方式。它支持 Claude Code、Codex、Grok Build、OpenCode 等一大堆 agent,用 OAuth 登录替代密钥管理,任意智能体都能接任意 OpenRouter 模型。护栏、允许列表与统一账单都在 OpenRouter 组织侧统一生效,适合想在一处管理多个模型与额度的团队。

vgpu 是专为智能体设计的 WebGPU 库,让一个 shader 在浏览器和无头 Node.js 里都能渲染,可交互、转视频或跑 CI。它像 TypeScript 那样导入导出 WGSL,还能用 CLI 校验 shader、拉参考示例与修复运行时。对做 Browser Use / Computer Use 类视觉智能体的开发者来说,把 WebGPU 图形能力塞给 agent 这条路,它铺得比大多数库都要顺。

vgpu 官网图,深色背景上白光穿过棱镜折射出彩虹,标注 The WebGPU library, designed for agents

tare 是一个 Claude Code 插件,让你直接问"我的用量去哪了"。它读 Claude Code 本地的请求日志,正确去重(日志格式会把每次响应重复若干次,朴素计数会夸大,在其构建数据上达 86%),把 token 的真实流向、被掏空的项目和反复重读的最贵文件都翻出来,还能告诉你被锁那一刻的滚动窗口有多满。全部在本机运行、零外传,那个名字的隐喻也很妙:扣掉容器自身的重量,才算得出里面装了什么。

Anthropic 开放的 Model Hardware Standard 是一份让 AI 智能体安全操作物理设备的共享规范,通过 MCP 让 agent 并行操控显微镜、液体处理器、机械臂等实验室与制造仪器。以往集成一套硬件要数周到数月,MHS 把它压缩到数小时甚至数分钟,还能让 agent 实时推理实验每一步、从硬件错误中恢复。它对任何有可编程接口的设备都适用,接下来会先与科学和制造伙伴打磨,再正式开源。

研究人员双手在实验室内操作显微镜等科研设备,呼应 Model Hardware Standard 让智能体操作物理设备

OpenAI 的 Rosalind Workbench 想解决科研里数据碎片化、工具割裂、实验记录难追踪的老大难问题,把数据、分析与实验记录统一进一个生命科学工作台。它构建在专属的生物学模型 GPT-Rosalind 之上,让你能在同一段对话里指挥模型、与分子结构查看器交互、检查证据链。从蛋白对接、纳米抗体设计到 RNA-seq 分析,都能在引导式工作流里跑通,计划、中间结果与支撑证据始终连通,正是"让每位科学家成为自己的科研团队"的样子。

Rosalind Workbench 的分子结构查看器界面,右侧显示 PDB 5LF3 蛋白酶体复合物彩色结构

StemDeck 是一款免费、开源、本地运行的 AI 分轨工具,能分离人声、鼓、贝斯、钢琴与原声吉他,兼顾练习、扒谱、混音与创意工作流。由于完全不把音频上传云端,它天然贴合看重隐私、需要离线使用或想绕开订阅制的音乐人。在云分轨方案扎堆的当下,这种本地开源的选择反倒成了稀缺品。

GitHub 官方这篇 如何在上线前评测 LLM 给出的方法论相当落地,源自给 secret scanning 降误报的真实项目。核心观点是先定义产品决策而非调模型:把指标分成主要结果、安全约束与运营护栏三层;把离线评测当成集成测试,一次次重跑并记录 prompt、模型与数据集版本;同时只一次改一个主要变量,确保归因清晰。这套"评测先行"的思路对任何要上生产的多数据管道团队都适用。

Cline 分享了如何在自家 loop 上搭一个可用的代码审查 agent,核心结论是代码审查没那么玄学:一个中央 agent 加上日志、记录发现的工具、护栏与一份指导文件就够了。它用 guidelines 告诉 agent 该标什么、严重级别怎么定、怎么深入调查而非只看 diff,再叠加一个防危险的 tool-guard。真正的亮点是 review 跑完再由一个更严的 judge 复核,只有值得人花时间的发现才会被保留,用一个干跑示例展示了完整的成本与结果。

Pi 的 Durable Harness v2 深入拆解了 AI agent 框架如何实现崩溃自愈。核心是确定性持久化:执行任何副作用前先写意图记录,完成后才提交结果,配合零中间态设计让系统重启后能精确定位到最近的安全边界。它还引入类似 Git 分支的 Lane 并发模型,用对 KV Cache 友好的追加式上下文降低 token 消耗,并支持一步步单步调试。对要做长驻 agent 或多分支 agent 的工程团队,这是一份很值得参考的工业级架构。

Serve Markdown to AI Agents 主张用 Accept: text/markdown 请求头做内容协商,让浏览器拿 HTML、agent 拿干净的 Markdown。好处是直接的:token 少、信噪比高、首个 token 更快,因为跳过了导航、脚本和布局标记。页面整理了 Nginx、Caddy、Next.js、Django 等一堆可复制的配置配方,还提供一个检测你的 URL 有多 AI-ready 的小工具。给 agent 时代的网站做内容交付,这只是顺手的一步。

RAG Is Simpler Than You Think 反对把 RAG 一上来就过度工程化。作者主张回到"正确的工具解决正确的问题",按检索复杂度从小到大给出六种递进方案:很多用例其实用纯全文搜索(BM25)就够了,再往上是 agentic 查询改写、混合搜索、on-the-fly 嵌入、冷热分层预嵌入,最后才是全量预嵌入。他的 80/20 判断很犀利:60% 的系统应该止步于"全文 + 查询改写",只有 10% 需要全量预嵌入,别为 60% 的问题去造 5% 级别的大招。

OCR It 是一个 Chrome / Firefox 扩展,专门对付那些无法选中文本的分页文档——扫描书、幻灯片或被锁住的阅读器。你一次性拖出捕获区域,之后每按一次热键就截图、OCR 并追加到进行中的转录,甚至能自动翻页把整本书变成文本。OCR 完全本地运行,不发布任何外发请求,所以几百页你本无法选中的内容,转眼就能丢给 Claude 或 ChatGPT 去总结、搜索与提问。

作者 把 LLM 记忆做成了程序分析 是个意外的妙招:他发现做漏洞挖掘调研时模型会逐渐忘记已建立的假设,于是把常规的"存旧观察再检索"换成用 Datalog 引擎维护当前已知状态。当一条观察两小时后被证伪,受影响的结论能自动失效,而不是让模型从头推断,还能追问"为什么相信这件事"。这套名为 Lemmalog 的系统在 LongMemEval 上用它两倍于全上下文的效果、却缩小约 38 倍的上下文达到接近 GPT-4.1 的水平,而改进主要来自修复一个个具体问题,不是把模型做大。

Apodex 1.1 想把 AI 深度搜索从"生成报告"升级为"解决复杂任务"。它在真实文件与代码环境中跑长链路,支持中途介入而无须从头再来,执行计划、产物与重试全程透明,还提供自主异步的多智能体并行探索与独立的关键结论审查来压幻觉。除了网页版,它还有个可本地部署的 35B Mini 和开源的终端 agent 框架 FrontierAgent,冲着科研、金融、法律这种长周期任务去的。

Anthropic 的 AI 原生软件工程实战手册 面向的是一个真问题:AI 写代码再快,SDLC 仍按"人类速度"跑,需求对齐、逐行 review 和层层审批反而成了瓶颈。它把传统线性研发流程重构为 Markdown 产物驱动的自治闭环——从 intent.mdspec.mdplan.md,构建与测试靠反馈闭环和自我纠偏,部署用双向审查与生产门禁卡点,运维阶段则由监控异常自动唤醒 Claude 出修复方案。本质是把研发从"人写代码"升级为"AI 闭环执行、人类把控评判"。

用纯 CMake 运行 GPT-2 是本周最灵性的一个实验:用 Q16.16 定点整数算术,在 CMake 脚本里完成 GPT-2 的前向推理。仓库里既有从 HuggingFace 下载的真权重完整模型,也有玩具模型与探针脚本,动手就能复现。把深度学习模型"翻译"成构建脚本,这个跨领域的趣味实验恰恰会让人重新审视所谓"推理"到底依赖什么。

Claude Cowork 内置浏览器 让 Claude 在桌面端不再需要你的浏览器。当任务涉及网站时,侧边栏会打开一个独立浏览器,Claude 自己导航、点击、输入,甚至能填表单、从仪表盘取数据、走通一个没有连接器的门户,而你的 tab、书签与密码它都看不到。Claude in Chrome 仍是浏览你已开页面的默认方式,两者可以随时切换。内置浏览器照旧强化了针对提示注入的防护,但它和任何在浏览器里行动的 agent 一样,最好从你信任的站点开始用。

Louis Abraham 的 The load-bearing vocabulary of Claude 用词频分析揭示 AI 编码代理对社会工程词汇的塑造:在 46 万条 GitHub Pull Request、约 5100 万个词里,聚类出一个 2026 年出现的词汇簇,上月占了所有人工署名 PR 的 40%。其中最突出的词是 load-bearing,出现频率是别处的 39 倍多,簇里还挤满了 plainly、refusal、provably、mutation-tested、behaviour-preserving 这类强调验证与证据的词。这份可视化把一个微妙的文化转变摆到了台面上:AI 编码代理的语言里,有种对鲁棒性、可复现性和证据导向近乎执念的关注。

Warp 公开了 在 Claude 上构建自改进 agent 的一套可复用模式。他们发现,对 agent 的反馈随会话结束就消失了,于是用 Agent Skills 搭出一个内层基础技能 + 外层改进技能的循环:内层技能承载领域知识,外层改进技能按计划运行,收集人类反馈后提出小而准的技能改动,再走正常的代码审查合并,下一次运行就继承了改进。写技能的原则是"写原则而非规则、解释为什么、让反馈随手可得"。这套框架让 Warp 的内部代码审查 agent 从噪音累累变成持续进化,值得想造自改进 agent 的人直接借鉴。

结语

这周最强烈的一个感受是,开源与自研不再是边缘选项,而是正在成为主线。权重这一侧,GLM、Qwen、腾讯把最强的模型一次次推到开源,还都在国产芯片上跑出了体面成绩;硬件这一侧,OpenAI 用 Jalapeño 挑战 NVIDIA 的推理经济学,NVIDIA 转头把 Hugging Face 收进版图。两者夹击之下,"算力即权力"的旧叙事正在松动。

与此同时,工具生态明显在往"让智能体更可靠、更本地、更懂长任务"的方向走。从崩溃自愈的 Harness、维护状态而非扩大上下文的记忆方案,到把反馈变成持续进化的自改进 agent,大家在解决同一个问题:怎么让 AI 不只跑得快,还靠得住。

下次更新,我们继续陪你看这个行业又走到了哪里。