中国开放权重模型领先:新数据显示谁真正在用
据CNBC 9月26日报道的使用数据,2026年9月14日当周,中国模型在OpenRouter上占全部token的57%至67%,2月时只有6%至13%。

现在有两张基准表在讲AI模型竞赛的故事。一张衡量模型在测试中表现多好,另一张衡量开发者实际为什么付费。2026年,第二张表先动了,方向是中国的开放权重模型。
CNBC 9月26日发布的使用数据显示,在两个开发者网关OpenRouter和Vercel上,中国模型从流量中的少数变成了多数。在OpenRouter上,它们在9月14日当周占所使用token的57%至67%,2月为6%至13%。在Vercel上,这一比例从1月的11%升至8月的55%。OpenRouter的数字覆盖美国、欧洲以及它定义的“全球南方”的公司,即中美洲、南美洲、非洲和亚洲的82个国家。Vercel没有说明地域分布。
这并不等于质量领先。CNBC报道称,美国最先进的模型仍在大多数基准上领先,美国前沿模型仍吸引更多总体支出。
先是价格,然后才是能力
OpenRouter洞察负责人Peter Walker告诉CNBC,今年发布的中国开源模型“能够可靠地完成高级智能体用例,尤其是在编程方面,这在2025年底根本不可能。”他还说,它们“与美国实验室的大多数模型相比,性价比极高。”
Vercel智能体基础设施负责人Harpreet Arora向CNBC直白地说明了机制:“中国模型正变得足够胜任更多任务,而成本低得多。一旦模型达到某项工作的质量门槛,价格差异就变得很有吸引力。”Arora还说,公司仍希望在一些更复杂的任务上使用美国前沿模型。这说明转变是针对特定工作负载的,而不是全面切换。
Anthropic研究与实验室产品管理负责人Dianne Penn告诉CNBC,公司正试图让模型回答“更高效,从而根据你的努力设置使用更少token。”OpenAI和Anthropic都在CNBC报道前一周发布了更便宜的模型。把这些与使用数据放在一起看,这是对价格问题的价格回应。
究竟是谁在切换
地理位置很重要。在OpenRouter定义的全球南方,企业是其系统中中国AI模型的最大用户,这些公司使用的token有67%流向中国模型。OpenRouter上约一半的token由美国公司使用。
新美国安全中心技术与国家安全项目高级研究员Daniel Remler告诉CNBC,中国的AI建设代表着“对美国真实的经济和安全风险”。他所说的担忧不是基准分数:“最终担忧在于,中国AI模型的整合会把各国拉入一个中国技术势力范围,并固化为地缘政治结盟。”
Remler说,东南亚尤其可能出现显著采用,因为与中国有经济和文化联系。“从拉各斯到圣保罗再到雅加达,任何创业者与政府寻找廉价、开放模型的地方,都会首先看向中国AI。”
据CNBC报道,美国众议院两个委员会正在调查中国模型采用率上升的影响,美国已通过出口管制限制中国AI公司购买最先进的芯片。华盛顿的担忧包括通过海外数据中心远程访问Nvidia芯片,以及“蒸馏”,即新模型模仿更早、更成熟的模型。CNBC称,在报道当周美国总统Donald Trump与中国国家主席习近平会晤时,AI是一个主要焦点。
底下的陈旧问题
模型发布被评判的方式还有第二个更安静的问题,它与地缘政治无关。发布日期是实验室交付模型的时间。训练截止日期是它停止阅读的时间。两者之间的差距,就是模型在发布当天已经落后多远。
9月16日发布的一个页面“你的AI有多陈旧?”列出了8个实验室20个模型的发布日期和训练截止日期。它把GPT-6 Astra定在2026年9月3日,训练截止日期为2026年4月30日。GPT-6 Sol的截止日期是2026年4月20日,GPT-6 Luna是2026年5月18日。Claude Opus 5.5和Claude Fable 5.1都在2026年6月停止阅读。该页面20个模型中有10个带有实验室公布的截止日期;其余标记为“未确定”,页面称这意味着所核查的供应商来源没有确定截止日期,而不是不存在截止日期。
“空白意味着所核查的供应商来源没有为该模型确定截止日期;这不能证明实验室从未公布过。”
该页面还报告了一项测试,看模型是否在应该使用搜索工具时使用它。在16个模型超过2000次调用中,每次都给一个网络搜索工具,前沿模型几乎每次都能正确决定,而较弱的模型在答案已经改变后仍凭记忆回答固定问题,却为水的沸点之类的事情搜索网络。在一个关于挪威国王的提示中,页面称有五个模型说出了一个死人。
页面认为,搜索并不能解决这个问题,因为会话结束时模型会忘记它读过的内容,而且是否搜索的决定运行在保存陈旧事实的同一组权重上。
小模型的反例
同一周并非每个发布都在追求规模。Cactus在9月18日发布Needle 3,这是一个面向微型设备的基础模型,具有9至29 MB的CQ2-bit二进制文件,以及29M至121M参数的阶梯式架构。其文档声称,4层子网络在下游任务上微调一个epoch后可以匹配DeepSeek V4 Flash,并报告在Raspberry Pi 5上解码达到400至4000 tokens/s。
9月21日,一个名为mini-AGI的项目发布了一个持续学习的字节级语言模型,在单个8 GB VRAM GPU上从零训练,读取一个数据流。其README称它是“一个小型玩具级模型”,并表示权重尚未发布,因为这次运行还在对语料的第一遍处理中。它迄今最低的留出损失为0.7417 nats,即每字符1.0700 bits,在7,879M字符中的562.9M处,数据进度为7.14%。
同一天,Cua以仅源代码研究发布的形式推出CUA-S1:小型、专门的“System 1”模型,用于计算机使用决策,例如选择哪个值应放入某个字段。公司将其描述为对快速、有界决策的工程类比,而不是通用智能体规划的替代品。
这三者都不会登上基准表榜首。这正是重点。发布周期现在同时运行在几条轨道上,而采用最快的那条并不是分数最好的那条。
资料来源
5- 01Chinese AI models surge in global popularity — and Washington is worriedEN
- 02How stale is your AI? Release age and training cutoff for 20 modelsEN
- 03Needle 3 - 8-29 MB foundation model for tiny devicesEN
- 04mini-AGI: Continual learning model trained from scratch on 8GB VRAMEN
- 05CUA-S1 – A System One Model for Computer UseEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。