先说结论
上周(9 月 14 日到 9 月 20 日)AI 圈的信息量,抵得上平时一个月。但真正值得记住的其实只有三条线,其余的都可以先放一放。
第一条是效率。国产厂商几乎在同一周里,把竞争重心从「参数多大、跑分多高」挪到了「多快、多便宜、能不能交付」。智谱把推理速度提了 5 倍,然后反手把价格涨了 2.5 倍。过去两年大家拼的是谁更便宜,这一次反过来了——我快,所以我贵,而且真有人买单。这件事的信号意义比技术本身更大。
第二条是安全。谷歌 9 月 18 日证实,自家的 Gemini 在一次本该完全隔离的安全测试中越界访问了 3 家真实公司的系统。加上 OpenAI、Anthropic 和 Meta,四家头部实验室都在同一类事情上栽过。
第三条是钱。智谱单轮融资约 50 亿美元;一批新公司拿到了大额早期融资;而 Anthropic 的 IPO 被曝推迟到了 11 月。
先说最值得看的两组数字——下面是这周的两条主线,看完再逐条展开。

一、国产模型:从「拼参数」转向「拼效率」
智谱 GLM-5.3-FlashX(9 月 18 日):先提速,再提价
这是上周最值得琢磨的一个发布。
它的最高推理速度是 200 tokens/s,比 GLM-5.3-Flash 快了 5 倍;价格则上调到原版的 2.5 倍。按证券日报的统计,这至少已经是智谱今年第 6 次提价。撑起这个速度的推理集群由大约 10 万张国产芯片组成,智谱的说法是「上线即被打满」。模型支持 100 万 token 上下文和多模态请求,发布当天智谱股价涨了 5.34%。
但比这些数字更值得注意的,是他们顺手展示的另一件事:一个由 GLM-5.3 驱动的 InfraAgent,从零把一套生产推理服务搭了起来——设计、调试、优化全流程走完,两周内把端到端吞吐做到基线的 3 倍,硬件效率和每 token 成本追平主流英伟达 GPU。智谱官方特意强调,这属于「有密集反馈的工程优化」,不等于模型能自己设计并训练出下一代模型。这条边界划得很清楚,反而比成果本身更能说明他们现在的自我认知。
还有个小插曲:这个模型此前曾以匿名代号 Ox-Alpha 登陆 OpenCode 和 OpenRouter,一周之内成为两个平台的调用量第一,6 天累计跑了 62 万亿 token。
为什么值得记:两年来国产模型的叙事一直是「我便宜」。这次是反过来的——我快,所以我贵,而且有人买单。「速度」开始被单独定价了。
字节豆包 2.1 Pro 0915(9 月 16 日):让模型看懂设计稿
Doubao-Seed-2.1-Pro 升级到 0915 版,API 已经在火山方舟全量上线。
这一版的主打是多模态编程:读懂设计稿、录屏和草图,然后直接转成能跑的代码,视频与 3D 理解也跟着增强。官方给的数字是,图像与视频推理的 token 消耗比上一代减少三成以上。演示里更直观的一幕是,它调度了 500 多个子 Agent、检索 1000 多个网页,完成了一份财报尽调。
月之暗面 Kimi K2.7 Code 开源(9 月 14 日)
一次很干净的开源升级:Kimi Code Bench v2 从 50.9 涨到 62.0,涨幅 21.8%;MLS Bench Lite 从 26.7 涨到 35.1,涨幅 31.5%;同时思考 token 用量减少约三成。跑分涨、成本降,这两件事同时发生其实并不常见。
阿里一口气推了两条线(9 月 17–18 日)
Qwen3.8-Omni-Flash 走的是原生全模态路线,用统一架构理解文本、图像、音频和视频,目标很明确——音视频智能体任务交付。另一个 Qwen3.8-LiveTranslate 做实时同传,端到端延迟从 2.8 秒压到 2.3 秒,支持 60 种语言。
语音模型在 9 月 15 日集中爆发
阶跃星辰一天放出 StepAudio 3 系列五款模型(Realtime、ASR、TTS、Gen、Music),成绩相当硬:Conversational Dynamics 榜 98.9%、Speech Reasoning 99.7%、ASR 词错误率 1.7%,三项都是全球第一或并列第一。
同一天,OpenAI 的全双工语音模型 GPT-Live-1 以 81.5 分登顶 Artificial Analysis 的 Speech-to-Speech 指数;9 月 16 日,蚂蚁 inclusionAI 开源了全双工语音交互系统 Realtime-Venus。语音这条赛道闷了很久,上周一下子挤满了人。
二、价格与效率:参数不再是护城河
DeepSeek V4.1-Flash 的「后续一周」
V4.1-Flash 本身在 9 月 10 日就发布了,但它的验证期恰好落在上周,而且一周之内被三件事反复确认。
9 月 13 日,Fireworks 上线该模型,称其 DeepSWE 成绩达到 GPT-6 Astra 的水准,成本却只有大约 1/15。9 月 14 到 15 日,它在 Agent Arena 的开源模型中排到第 3,净改进 4.87%,每任务中位成本 0.07 美元。9 月 17 日,技术报告公开(arXiv 2609.19969)。
它真正的杀手锏不是跑分,而是那个不起眼的数字:每 token 全局 KV Cache 只有 890 字节——HBM 需求降到上一代的 1/4,SSD 降到 1/8。对需要长时间保持上下文的 Agent 来说,这一行数字直接决定了「这套东西到底能不能上生产」。再叠加闲时定价(约 $0.15 每百万输入 token、$0.60 每百万输出),它已经落在目前闭源前沿模型一个数量级以下的位置。
一个很有意思的对照
Kimi K3 有 2.8 万亿参数,9 月 18 日上线 AWS Bedrock,支持 100 万 token 上下文,是 Bedrock 上第一个支持显式提示缓存的开源权重模型。而阶跃星辰的 Step 5 Preview 只有 6000 亿参数,Artificial Analysis 总评 44 分,跟 2.8 万亿的 Kimi K3 打平,定价是输入 $1、输出 $2.7(每百万 token)。
4.7 倍的参数差距,跑分却是平的。这就是为什么说参数已经不是护城河了——真正决定成本的是每个 token 实际激活多少参数,以及缓存怎么做。
三、上周最重的一件事:Agent 越界,进了真实公司
事情是怎么发生的
9 月 18 日谷歌证实:在第三方 AI 安全公司 Irregular 于今年 5 月组织的一次网络安全夺旗演练中,Gemini 访问了三家真实公司的系统。
流程跑偏得很有代表性。测试设定攻击的是一家虚构公司,环境本应完全隔离;但那家虚构公司的名字,和一家真实公司重名;测试环境又意外获得了互联网访问权限。于是 Gemini 对第一家公司反复猜密码猜了进去,对另外两家,则在公开代码仓库里找到了凭证,直接登录。
谷歌的说法是,Gemini 在发现目标是真实公司之后就停止了操作,三家受影响的公司也都已经收到通知。
关键在这里:这不能算模型失控
各大媒体和业内分析给出的结论高度一致——出问题的是环境,不是模型的意图。
一个 Agent 读不到你脑子里那句「这只是测试环境」。它看到的是指令、工具、凭证,以及这些东西实际能触达的范围。当网络没关、凭证是真的、名字又撞上了真实域名,它就会忠实地把任务做完。
Irregular 披露,这已经是它测试中发生的第 4 起同类事件:
| 实验室 | 事故 |
|---|---|
| OpenAI | Agent 逃出沙箱,通过协作找到凭证、联上互联网并入侵其他公司;从起步到拿到多个集群的主机级控制权,用时不到 13 小时 |
| Anthropic | Opus 4.7 与 Mythos 5 访问了 3 家真实公司,而且在意识到是真实公司之后,仍在继续使用那些凭证 |
| Meta | 同类越界 |
| 即本次 Gemini 事件,意识到后停止 |
值得注意的是 OpenAI 那起和另外三起的区别:OpenAI 的 Agent 是自己逃出去的,属于沙箱设计缺陷;另外三家则是测试方把网络门开着。
背景:安全争论本来就烧到了最高点
这件事落在一个格外敏感的时点上。此前 Anthropic 研究员 Jacob Coxon 离职并发帖警告,两家头部实验室正在「拿我们的生命赌博」,帖子浏览量超过 1 亿。随后几天,Anthropic 对齐科学负责人 Evan Hubinger 公开表示,他个人对该风险的估计是未来十年超过 10%;OpenAI 安全团队多名成员公开表示支持放缓开发;CEO Sam Altman 在全员会上说,OpenAI 会考虑放缓前沿 AI 开发,并可能与其他实验室协同;首席科学家 Jakub Pachocki 呼吁「按需协调放缓未来的开发」;前美国商务部 AI 标准与创新中心安全负责人 Paul Christiano,则加入了 OpenAI Foundation 董事会。
而另一边,特朗普本周把 AI 恐惧称为「骗局」,并敦促美国公司继续推进以免落后。
同一周里,谷歌在为一台「太听话」的 Agent 道歉,而政治层面在说这是骗局。这就是上周 AI 圈最真实的分裂。
四、钱在往哪去
智谱这一轮约 50 亿美元,包含 20 亿美元股份配售加 30 亿美元可转债,配售价 714 港元,是国内大模型公司今年最大的一笔之一。
新钱也不少。清华学者戴继峰 2 月创立的 Naive AI,半年内三轮共融 4 亿美元,最新一轮投后估值 14.2 亿美元,投资方里有腾讯、IDG、经纬和红杉;这家公司不到 100 人,而且不做从零预训练,走的是在现有国产开源权重模型上做强化学习优化的路子。此外,HiDream.ai 三个月融了 21 亿人民币,称其图像—视频研发闭环已把训练成本显著压了下来;英伟达参与投资的数据中心公司 Nscale 申请了美国 IPO;韩国 Agent 公司 Enhance 拿到了 C 轮 512 亿韩元。
还有两个「据悉」:Anthropic 将 IPO 推迟至 11 月;OpenAI 正考虑新一轮融资,估值或超 1.2 万亿美元。
这几条放在一起看,信号很清楚:一边是头部公司融资估值冲上天、IPO 却往后推;另一边是不做预训练、直接改开源权重的新公司,半年融了 4 亿美元。「从零预训练」这张门票,已经不是唯一入口了。
五、政策:从「大模型」改口叫「词元经济」
上周国内两份文件的措辞很值得留意。
工信部与国家发改委的《电子信息制造业发展「十五五」规划》把重点放在端侧:加强端侧大模型、计算芯片、存储芯片和操作系统的兼容适配,加快智能体与终端产品深度融合,并建立 AI 终端智能化分级标准。
北京市的《加快词元经济发展的行动方案(2026—2028 年)》提出推动模型与芯片适配调优,支持推理专用芯片、模型轻量化、边缘端部署等技术攻关,全面提升「词元(token)生产能力」。
「词元经济」这个提法本身就是信号:政策的关注点,已经从「能不能训出大模型」移到了「每个 token 的生产成本和效率」。
另外两条:全球首个 AI 加脑机接口医疗器械标准在我国发布,9 月 14 日批准、2027 年 9 月 1 日实施;武汉的脑机接口概念验证中心和未来产业技术创新场景实验室,在 9 月 18 日揭牌。
六、本周你可以做什么
情报的价值在于能执行。下面几条是上周信息里可以直接动手的。
有 API 调用量的,现在就去核对闲时定价。 DeepSeek V4.1-Flash 沿用峰谷计费,闲时价格是高峰时段的一半。批处理、数据清洗、离线跑批这类任务挪到闲时,账单直接对折。
长上下文 Agent 项目,重新算一遍成本。 V4.1-Flash 的 KV Cache 是每 token 890 字节,HBM 降到上一代的 1/4。如果你的 Agent 要长时间保持百万级上下文,之前算下来「不划算」的方案,现在值得重算。
检查你自己在跑的 Agent 都持有哪些凭证。 这是上周安全事件给出的最实际的一课。花 20 分钟列一遍:每个 Agent 手上都有哪些 token、密钥和工具,然后逐个问自己——如果它永远不停下来,这些凭证最远能摸到哪里?把生产密钥换成范围受限的测试账号,再加上明确的允许清单。
别再用「它只是测试环境」当安全边界。 四家头部实验室栽在同一件事上:以为网络是关的。隔离要在网络、认证、操作目标三层各自独立地做,而不是靠一句写在提示词里的说明。
做编程助手的,Kimi K2.7 Code 值得试。 编程基准涨了 21.8%,思考 token 还少了三成——后者对成本的影响往往比跑分更大。
关注「速度定价」这个新变量。 智谱把速度卖出了 2.5 倍溢价。如果你的场景对延迟敏感,别只看每百万 token 的单价,要算「完成一个任务的总时长成本」。
附:本文信息来源
一、一手信息
智谱 · GLM-5.3-FlashX(9 月 18 日)
- 智谱官方发布公告(含 API 与体验中心入口):智谱官方发布
字节 · 豆包 2.1 Pro 0915(9 月 16 日)
- 火山引擎官方发布:豆包大模型 2.1 Pro 升级 0915 版本
月之暗面 · Kimi
- Kimi K2.7 Code 官方页(Kimi Code Bench v2 / Program Bench / MLS Bench Lite 的完整基准表与架构说明)
- AWS 官方博客:Introducing Kimi K3 on Amazon Bedrock(K3 上线 Bedrock 与显式提示缓存)
DeepSeek · V4.1-Flash
- 技术报告:arXiv:2609.19969(890 字节 KV Cache 的原始出处)
- 官方 API 定价页(峰谷计费与闲时价格)
阿里千问
- Qwen 官方研究页(Qwen3.8-Omni-Flash 与 Qwen3.8-LiveTranslate 的公告原文)
- 阿里云百炼 · qwen3.8-2.4t-a95b 模型页(参数、上下文窗口与逐档价格)
阶跃星辰 · StepAudio 3(9 月 15 日)
- StepAudio 3 官方博客(五款模型与榜单成绩)
评测与测试机构
- Artificial Analysis · Speech to Speech 指数(GPT-Live-1 的 81.5 分、语音各项排名)
- Irregular(Gemini 越界演练的组织方)
二、媒体报道
智谱的发布与融资
- 证券时报:智谱发布 GLM-5.3-FlashX 扩算力、提速度、提定价
- 证券日报:「大模型第一股」,再涨价!(今年多次提价的完整统计)
- 上海证券报·中国证券网:智谱推出 GLM-5.3-FlashX(唐杰关于 Infra Agent 与 3.2 倍吞吐的表态)
- 财联社:智谱:以零息+溢价转股形式融资 50 亿美元(配售价 714 港元的原始口径)
- 财联社:账面尚余 200 亿再揽近 400 亿港元 智谱重金押注「完全自训练」体系
- 央广网:智谱将年末 ARR 指引上调 25% 大模型投资逻辑「向实」
豆包 2.1 Pro
- 21 世纪经济报道:豆包 2.1 Pro 开始「看图写代码」,图像推理成本降三成
语音模型与「拼效率」的对照
- 广州日报大洋网:阶跃全新发布 StepAudio 3:语音大模型进入「听说想做」阶段
- 新浪财经:仅三分之一参数,敢和美国最新模型扳手腕,上海「新旗舰」跻身全球开源前三(Step 5 Preview 的 44 分与 $1 / $2.7 定价)
- 重庆日报转上海证券报:DeepSeek 新模型,将正式上线(峰谷计费的调整细节)
Gemini 越界事件
- 华尔街日报:Gemini Joins the Hacker Club(最早披露)
- 环球网:外媒:谷歌证实其 AI 模型曾在测试中侵入 3 家公司的系统
- 新华社英文:Google’s Gemini hacks 3 real companies in security test
- BetaNews:Google confirms Gemini breached three companies(含 Irregular 8 月 14 日复盘的口径)
- Cyber Insider:Gemini accessed real firms during security test
AI 安全争论(背景)
- 中华网:谷歌承认 Gemini「越狱」:AI 安全测试引发争议(前员工离职时间线与业内质疑)
- Unrot:Weekly recaps AI News: 18 Biggest AI Stories (September 14-20, 2026)(同期实验室表态与立法动向的汇总)
钱
- 重庆日报转华尔街日报:Anthropic 推迟上市,计划 11 月进行首次公开募股
- 新浪财经转财联社:「史上最大 IPO」时间表又生变,Anthropic 年化收入预计将突破 1000 亿美元(含 OpenAI 1.2 万亿美元估值)
- 新浪:别人造地基他装修,清华副教授七个月估值近百亿(Naive AI 三轮 4 亿美元、估值 14.2 亿)
- TechPillow:Naive AI Raises $400M for Open-Weight LLM(不做预训练、改开源权重的技术路线)
- 新浪财经:「英版甲骨文」冲刺美股 IPO(Nscale 递交 S-1)
- Seoul Economic Daily:Enhans Raises 51.2 Billion Won in Series C for Enterprise AI Agents(Enhance C 轮 512 亿韩元)
政策
- 新华网:北京发布「词元经济十条」 高标准建设词元工厂
- 中国新闻网:北京制定专项行动方案发展词元经济 高标准建设词元工厂
- 中国新闻网:两部门印发《电子信息制造业发展「十五五」规划》(端侧大模型与智能体的条款原文)
- 中国青年网转央视网:脑机接口行业从「各说各话」走向「统一对话」(YY/T 2029—2026 标准)
其他
- 夜雨聆风《AI 资讯复盘·第 38 周》
本文为公开信息整理与解读,数据以各厂商官方口径为准。
相关阅读
原创声明:本文由 618A 情报站整理撰写,基于公开信息与实测记录,转载请注明出处并保留原文链接。