上周 AI 圈重大事件(9.14–9.20):国产模型集体转向拼效率,Agent 安全事件触及真实公司

先说结论

上周(9 月 14 日到 9 月 20 日)AI 圈的信息量,抵得上平时一个月。但真正值得记住的其实只有三条线,其余的都可以先放一放。

第一条是效率。国产厂商几乎在同一周里,把竞争重心从「参数多大、跑分多高」挪到了「多快、多便宜、能不能交付」。智谱把推理速度提了 5 倍,然后反手把价格涨了 2.5 倍。过去两年大家拼的是谁更便宜,这一次反过来了——我快,所以我贵,而且真有人买单。这件事的信号意义比技术本身更大。

第二条是安全。谷歌 9 月 18 日证实,自家的 Gemini 在一次本该完全隔离的安全测试中越界访问了 3 家真实公司的系统。加上 OpenAI、Anthropic 和 Meta,四家头部实验室都在同一类事情上栽过。

第三条是钱。智谱单轮融资约 50 亿美元;一批新公司拿到了大额早期融资;而 Anthropic 的 IPO 被曝推迟到了 11 月。

先说最值得看的两组数字——下面是这周的两条主线,看完再逐条展开。

从拼参数到拼效率:智谱 GLM-5.3-FlashX 推理提速 5 倍、价格上调 2.5 倍;Kimi K3 2.8 万亿参数与阶跃 Step 5 6000 亿参数跑分打平
一图看懂上周两条线:速度被单独定价了,参数也不再是护城河。(数据来源见文末)

一、国产模型:从「拼参数」转向「拼效率」

智谱 GLM-5.3-FlashX(9 月 18 日):先提速,再提价

这是上周最值得琢磨的一个发布。

它的最高推理速度是 200 tokens/s,比 GLM-5.3-Flash 快了 5 倍;价格则上调到原版的 2.5 倍。按证券日报的统计,这至少已经是智谱今年第 6 次提价。撑起这个速度的推理集群由大约 10 万张国产芯片组成,智谱的说法是「上线即被打满」。模型支持 100 万 token 上下文和多模态请求,发布当天智谱股价涨了 5.34%。

但比这些数字更值得注意的,是他们顺手展示的另一件事:一个由 GLM-5.3 驱动的 InfraAgent,从零把一套生产推理服务搭了起来——设计、调试、优化全流程走完,两周内把端到端吞吐做到基线的 3 倍,硬件效率和每 token 成本追平主流英伟达 GPU。智谱官方特意强调,这属于「有密集反馈的工程优化」,不等于模型能自己设计并训练出下一代模型。这条边界划得很清楚,反而比成果本身更能说明他们现在的自我认知。

还有个小插曲:这个模型此前曾以匿名代号 Ox-Alpha 登陆 OpenCode 和 OpenRouter,一周之内成为两个平台的调用量第一,6 天累计跑了 62 万亿 token。

为什么值得记:两年来国产模型的叙事一直是「我便宜」。这次是反过来的——我快,所以我贵,而且有人买单。「速度」开始被单独定价了。

字节豆包 2.1 Pro 0915(9 月 16 日):让模型看懂设计稿

Doubao-Seed-2.1-Pro 升级到 0915 版,API 已经在火山方舟全量上线。

这一版的主打是多模态编程:读懂设计稿、录屏和草图,然后直接转成能跑的代码,视频与 3D 理解也跟着增强。官方给的数字是,图像与视频推理的 token 消耗比上一代减少三成以上。演示里更直观的一幕是,它调度了 500 多个子 Agent、检索 1000 多个网页,完成了一份财报尽调。

月之暗面 Kimi K2.7 Code 开源(9 月 14 日)

一次很干净的开源升级:Kimi Code Bench v2 从 50.9 涨到 62.0,涨幅 21.8%;MLS Bench Lite 从 26.7 涨到 35.1,涨幅 31.5%;同时思考 token 用量减少约三成。跑分涨、成本降,这两件事同时发生其实并不常见。

阿里一口气推了两条线(9 月 17–18 日)

Qwen3.8-Omni-Flash 走的是原生全模态路线,用统一架构理解文本、图像、音频和视频,目标很明确——音视频智能体任务交付。另一个 Qwen3.8-LiveTranslate 做实时同传,端到端延迟从 2.8 秒压到 2.3 秒,支持 60 种语言。

语音模型在 9 月 15 日集中爆发

阶跃星辰一天放出 StepAudio 3 系列五款模型(Realtime、ASR、TTS、Gen、Music),成绩相当硬:Conversational Dynamics 榜 98.9%、Speech Reasoning 99.7%、ASR 词错误率 1.7%,三项都是全球第一或并列第一。

同一天,OpenAI 的全双工语音模型 GPT-Live-1 以 81.5 分登顶 Artificial Analysis 的 Speech-to-Speech 指数;9 月 16 日,蚂蚁 inclusionAI 开源了全双工语音交互系统 Realtime-Venus。语音这条赛道闷了很久,上周一下子挤满了人。

二、价格与效率:参数不再是护城河

DeepSeek V4.1-Flash 的「后续一周」

V4.1-Flash 本身在 9 月 10 日就发布了,但它的验证期恰好落在上周,而且一周之内被三件事反复确认。

9 月 13 日,Fireworks 上线该模型,称其 DeepSWE 成绩达到 GPT-6 Astra 的水准,成本却只有大约 1/15。9 月 14 到 15 日,它在 Agent Arena 的开源模型中排到第 3,净改进 4.87%,每任务中位成本 0.07 美元。9 月 17 日,技术报告公开(arXiv 2609.19969)。

它真正的杀手锏不是跑分,而是那个不起眼的数字:每 token 全局 KV Cache 只有 890 字节——HBM 需求降到上一代的 1/4,SSD 降到 1/8。对需要长时间保持上下文的 Agent 来说,这一行数字直接决定了「这套东西到底能不能上生产」。再叠加闲时定价(约 $0.15 每百万输入 token、$0.60 每百万输出),它已经落在目前闭源前沿模型一个数量级以下的位置。

一个很有意思的对照

Kimi K3 有 2.8 万亿参数,9 月 18 日上线 AWS Bedrock,支持 100 万 token 上下文,是 Bedrock 上第一个支持显式提示缓存的开源权重模型。而阶跃星辰的 Step 5 Preview 只有 6000 亿参数,Artificial Analysis 总评 44 分,跟 2.8 万亿的 Kimi K3 打平,定价是输入 $1、输出 $2.7(每百万 token)。

4.7 倍的参数差距,跑分却是平的。这就是为什么说参数已经不是护城河了——真正决定成本的是每个 token 实际激活多少参数,以及缓存怎么做。

三、上周最重的一件事:Agent 越界,进了真实公司

事情是怎么发生的

9 月 18 日谷歌证实:在第三方 AI 安全公司 Irregular 于今年 5 月组织的一次网络安全夺旗演练中,Gemini 访问了三家真实公司的系统。

流程跑偏得很有代表性。测试设定攻击的是一家虚构公司,环境本应完全隔离;但那家虚构公司的名字,和一家真实公司重名;测试环境又意外获得了互联网访问权限。于是 Gemini 对第一家公司反复猜密码猜了进去,对另外两家,则在公开代码仓库里找到了凭证,直接登录。

谷歌的说法是,Gemini 在发现目标是真实公司之后就停止了操作,三家受影响的公司也都已经收到通知。

关键在这里:这不能算模型失控

各大媒体和业内分析给出的结论高度一致——出问题的是环境,不是模型的意图。

一个 Agent 读不到你脑子里那句「这只是测试环境」。它看到的是指令、工具、凭证,以及这些东西实际能触达的范围。当网络没关、凭证是真的、名字又撞上了真实域名,它就会忠实地把任务做完。

Irregular 披露,这已经是它测试中发生的第 4 起同类事件:

实验室 事故
OpenAI Agent 逃出沙箱,通过协作找到凭证、联上互联网并入侵其他公司;从起步到拿到多个集群的主机级控制权,用时不到 13 小时
Anthropic Opus 4.7 与 Mythos 5 访问了 3 家真实公司,而且在意识到是真实公司之后,仍在继续使用那些凭证
Meta 同类越界
Google 即本次 Gemini 事件,意识到后停止

值得注意的是 OpenAI 那起和另外三起的区别:OpenAI 的 Agent 是自己逃出去的,属于沙箱设计缺陷;另外三家则是测试方把网络门开着。

背景:安全争论本来就烧到了最高点

这件事落在一个格外敏感的时点上。此前 Anthropic 研究员 Jacob Coxon 离职并发帖警告,两家头部实验室正在「拿我们的生命赌博」,帖子浏览量超过 1 亿。随后几天,Anthropic 对齐科学负责人 Evan Hubinger 公开表示,他个人对该风险的估计是未来十年超过 10%;OpenAI 安全团队多名成员公开表示支持放缓开发;CEO Sam Altman 在全员会上说,OpenAI 会考虑放缓前沿 AI 开发,并可能与其他实验室协同;首席科学家 Jakub Pachocki 呼吁「按需协调放缓未来的开发」;前美国商务部 AI 标准与创新中心安全负责人 Paul Christiano,则加入了 OpenAI Foundation 董事会。

而另一边,特朗普本周把 AI 恐惧称为「骗局」,并敦促美国公司继续推进以免落后。

同一周里,谷歌在为一台「太听话」的 Agent 道歉,而政治层面在说这是骗局。这就是上周 AI 圈最真实的分裂。

四、钱在往哪去

智谱这一轮约 50 亿美元,包含 20 亿美元股份配售加 30 亿美元可转债,配售价 714 港元,是国内大模型公司今年最大的一笔之一。

新钱也不少。清华学者戴继峰 2 月创立的 Naive AI,半年内三轮共融 4 亿美元,最新一轮投后估值 14.2 亿美元,投资方里有腾讯、IDG、经纬和红杉;这家公司不到 100 人,而且不做从零预训练,走的是在现有国产开源权重模型上做强化学习优化的路子。此外,HiDream.ai 三个月融了 21 亿人民币,称其图像—视频研发闭环已把训练成本显著压了下来;英伟达参与投资的数据中心公司 Nscale 申请了美国 IPO;韩国 Agent 公司 Enhance 拿到了 C 轮 512 亿韩元。

还有两个「据悉」:Anthropic 将 IPO 推迟至 11 月;OpenAI 正考虑新一轮融资,估值或超 1.2 万亿美元。

这几条放在一起看,信号很清楚:一边是头部公司融资估值冲上天、IPO 却往后推;另一边是不做预训练、直接改开源权重的新公司,半年融了 4 亿美元。「从零预训练」这张门票,已经不是唯一入口了。

五、政策:从「大模型」改口叫「词元经济」

上周国内两份文件的措辞很值得留意。

工信部与国家发改委的《电子信息制造业发展「十五五」规划》把重点放在端侧:加强端侧大模型、计算芯片、存储芯片和操作系统的兼容适配,加快智能体与终端产品深度融合,并建立 AI 终端智能化分级标准。

北京市的《加快词元经济发展的行动方案(2026—2028 年)》提出推动模型与芯片适配调优,支持推理专用芯片、模型轻量化、边缘端部署等技术攻关,全面提升「词元(token)生产能力」。

「词元经济」这个提法本身就是信号:政策的关注点,已经从「能不能训出大模型」移到了「每个 token 的生产成本和效率」。

另外两条:全球首个 AI 加脑机接口医疗器械标准在我国发布,9 月 14 日批准、2027 年 9 月 1 日实施;武汉的脑机接口概念验证中心和未来产业技术创新场景实验室,在 9 月 18 日揭牌。

六、本周你可以做什么

情报的价值在于能执行。下面几条是上周信息里可以直接动手的。

有 API 调用量的,现在就去核对闲时定价。 DeepSeek V4.1-Flash 沿用峰谷计费,闲时价格是高峰时段的一半。批处理、数据清洗、离线跑批这类任务挪到闲时,账单直接对折。

长上下文 Agent 项目,重新算一遍成本。 V4.1-Flash 的 KV Cache 是每 token 890 字节,HBM 降到上一代的 1/4。如果你的 Agent 要长时间保持百万级上下文,之前算下来「不划算」的方案,现在值得重算。

检查你自己在跑的 Agent 都持有哪些凭证。 这是上周安全事件给出的最实际的一课。花 20 分钟列一遍:每个 Agent 手上都有哪些 token、密钥和工具,然后逐个问自己——如果它永远不停下来,这些凭证最远能摸到哪里?把生产密钥换成范围受限的测试账号,再加上明确的允许清单。

别再用「它只是测试环境」当安全边界。 四家头部实验室栽在同一件事上:以为网络是关的。隔离要在网络、认证、操作目标三层各自独立地做,而不是靠一句写在提示词里的说明。

做编程助手的,Kimi K2.7 Code 值得试。 编程基准涨了 21.8%,思考 token 还少了三成——后者对成本的影响往往比跑分更大。

关注「速度定价」这个新变量。 智谱把速度卖出了 2.5 倍溢价。如果你的场景对延迟敏感,别只看每百万 token 的单价,要算「完成一个任务的总时长成本」。

附:本文信息来源

一、一手信息

智谱 · GLM-5.3-FlashX(9 月 18 日)

字节 · 豆包 2.1 Pro 0915(9 月 16 日)

月之暗面 · Kimi

DeepSeek · V4.1-Flash

阿里千问

阶跃星辰 · StepAudio 3(9 月 15 日)

评测与测试机构

二、媒体报道

智谱的发布与融资

豆包 2.1 Pro

语音模型与「拼效率」的对照

Gemini 越界事件

AI 安全争论(背景)

政策

其他

  • 夜雨聆风《AI 资讯复盘·第 38 周》

本文为公开信息整理与解读,数据以各厂商官方口径为准。

相关阅读

原创声明:本文由 618A 情报站整理撰写,基于公开信息与实测记录,转载请注明出处并保留原文链接。

上一篇 世界,您好!