三伍新闻资讯,有趣实用的生活常识!

最新更新文章排行

三伍新闻资讯

当前位置: 首页 > AI智能

国产大模型,贵到用不起

时间:2026-07-30人气: 作者: 佚名

就最近的这一个月而言, 在硅谷的AI领域当中, 真可说是大招频繁出现, 先是GPT - 5.6问世后, 紧接着Grok - 4.5也接连诞生了。

一刹那间, 国内从事开发工作的人员、程序员这一群体, 全都情绪高涨起来, 各种各样跟GPT - 5.6等处于前沿位置的模型相关的讨论, 以及测评活动, 接连不断地出现。

虽然在这个月, 有Kimi-K3这类新锐国产模型出现。可是整体来说, 国产大模型目前在一线开发者群体之中。一直处在一种“称作很好却不怎么受欢迎”的状况。

图片

数据按照最新的来讲, 就使用量这方面而言: 在日期处于6月22日至28日的时候所显示的数据表明, 在调用量上, 中国模型周的时候数额达到了20.39万亿Token, 而相较来说美国模型的调用量数值是4.25万亿, 在这一情况里, 中国模型在调用量上已是连续九周处于领先地位了, 有这样的状况。

只不过, 与之构成反差状况的是, 国内被称作AI六小龙的那些企业, 在营收这一方面所展现出来的表现, 并非怎么显得尽如人意: 根据公开的财报内容可以看到, 智谱在2025年的时候, 其营收数额为7.24亿元, 然而亏损额度却达到了30亿元以上, 折合为7900万美元, 大约是5.7亿元;月之暗面以及其余的四家企业, 尚未对外披露完整的年度营收情况。

即使头部企业,收入仍停留在数亿元量级。

比较而言, 身为AI头部企业的它, 其ARR已然达到大约600亿至700亿美元, 主要的驱动力是B2B API以及AI场景。

这不由得引出了一个尖锐的问题:

为什么被称作“便宜”, 且“调用量大”的国产模型, 直到现在依旧是叫好不叫座呢, 在AI这类高价值的场景当中, 直至如今仍然很难跟国外顶尖模型进行正面的抗衡吗?

于近期, 笔者借助与好些一线开发者展开深度剖析此问题之后, 察觉到了一项颇为违背直观感受的事实。

国产大模型,某种程度上其实非常“贵”。

也是这样的那种“贵”, 致使某些在性能方面存在突破的, 国产的那些模型, 难以去真正全方位地呈现出自身的带有明显优势的闪光点。

01“低价”的幻觉

当提及国产大模型, 不少人脑海中浮现的皆是、Kimi、智谱这般的代表, 然而与它们绑定最为紧密的标签当中, 有一个便是, 价格低廉、收费便宜。

要是单单从Token单价这个角度去看, 国产模型跟GPT - 5.6等这类顶尖模型相比较而言, 的确是存在着不小的优势, 就拿GLM - 5.2和V4来进行举例: GLM - 5.2每百万Token输入是1.4美元, 输出是4.4美元,  - V4 - Pro输入为0.435美元, 输出为0.87美元;GPT - 5.6 Sol输入是5美元, 输出是30美元, Fable 5输入则是10美元, 输出是50美元。

但实际上,这种“低价”的印象,是一种圈外人长久的误区。

特别是在高强度进行编程操作的场景里头, 国产大型模型的单个价格方面不但不具备优势, 甚至于还反倒比享有套餐的那一款gpt多出好几倍贵了。

有个化名李光的, 属于科研工作者, 身处AI领域, 因工作所需, 每日都得在AI场景里耗费几十亿Token, 在这般消耗量情形下, 要是采用国产大模型, 像GLM - 5.2, 那整体成本会变得极其吓人。

图片

李光晒出的Token账单

谈天那日, 李光  的 Token 已然快要接近 40 亿, 这儿稍微能够做一下换算啦, 要是他用时使用的是 GLM - 5.2的话, 成本大略是这样算的, 由(8639万普通输入×1.4美元+33.80亿缓存输入×0.26美元+1906万输出及推理×4.4美元)得数约为 1084 美元, 按照 1 美元兑 7.2 元来估算, 大约差不多合人民币 7800 元。

而致使李光这般毫无顾忌地去烧Token的缘由, 乃是由于他开启了GPT的CodeX套餐。

这里针对编程场景相关的CodeX套餐具体形式做个简要阐释, 简单来讲, 它是一款针对编程场景而推出的套餐, 严格来讲的话, 它并非确实不限量啊, 而是将Codex纳入到订阅范畴内, Plus套餐是每月20美元, Pro套餐从每月100美元起, 其额度大概是Plus套餐的5倍或是20倍, 当触碰到规定上限之后能够购买从而继续使用。

同样地, Code有着一套与之类似的套餐, 其具体形式呈现为: Pro的价格是每月20美元, Max 5x的价格是每月100美元, Max 20x的价格是每月200美元;网页端跟Code共享每5小时以及每周的额度, 当达到上限之后能够按照API价格继续使用。

在这样的套餐兜底下,巨大的Token成本反而被抹平了。

就国内的开发者而言, 在那种高强度的AI场景这下边, 每天都要消耗几十亿Token, 甚至还要消耗上百亿Token, 这成为了一种非常普遍的常态情况。

实际一周, 小刘在Codex上的花费是300元人民币, 他是一个AI的重度开发者, 且这还是在没有公司报销的情况下。

不过即便就是这样的成本水平, 拿去跟国产模型作出对比, 却依旧显得“便宜”了不少, 原因在于同样是300元这个金额, 根本就没办法买到GLM 5.2同等数量的token。

图片

小刘的Token账单

对国内开发者而言, GPT的codex套餐, 是当下所能买到的最为便宜的token, 比起智谱、kimi便宜许多倍, 这兴许有违直觉, 然而事实便是国产模型于高强度场景之中, 性价比根本没法与之相较。

需要在此处加以说明的是, codex并非是那种在真正意义层面上的不限量套餐, 要是按照最高档的200美元进行计算的话, 那么一周大概会拥有20亿的额度。

然而, 基于部分开发者会借由“中转站”此类手段去运用模型, 致使某些模型的实际成本比官方渠道明显低不少, 因而偶尔可以凭借更低的价钱购得更多Token, 如此一来便出现了300块能买到120亿Token的这种情况。

实际情况中, 国产模型这一块儿, 于定价这个层面上, 并非全然没有推出过相像的套餐;然而呢, 假若仔细深入探究一番来看的话, 这样子的套餐本身, 在限额这个范畴之内, 跟那个codex比较来讲, 是存在着极为显著的很大限制之处的。

02国产定价之痛

国产大模型在定价方面的现状,可以用一句话来形容:

你觉得自己进入的是那种提供自助餐的场地, 然而到了最后却发觉, 商家实际上依旧是按照重量来进行计费的。

国内的Kimi、GLM - 5.2, 在套餐之上举例来谈, Kimi Code分成49、99、199、699元这四档, 额度依照周进行刷新。GLM Plan的Lite、Pro、Max, 每5小时分别大概是80、400、1600次, 每周大约是400、2000、8000次, 且GLM - 5.2在高峰期是按照3倍来扣额。

就拿阿里的qoder当作例子, 按照笔者一位从事与B端客户运维相关工作的、化名为阿迷的朋友所说, qoder曾在国内是最好用的AI IDE, 可遗憾在于, 其自身制定的新定价, 把它原本所具有的优势给弄没了。

在套餐这一方面, Qoder CN个人Pro套餐价格是59元每月, Qoder CN个人Pro+套餐价格是169元每月, 其中Qoder CN个人Pro套餐包含2000, Qoder CN个人Pro+套餐包含6000。Teams套餐价格是9每个席位每月9元, VPC版套餐价格是每个席位每月199元, 它们都包含3000 , 并且VPC版套餐50席起售。

阿迷后来介绍道, 今年他们合并灵码, 调了定价之后, 就我所知道的, 至少都有二三十家放弃续费了。

通过阿迷所做的测试, qoder企业版199的那份套餐内容, 以他的使用方式, 3天就消耗殆尽了, 要是依照重度开发者的使用方式, 推测一天就会消耗光了。

同样的情况呢, 在套餐这一方面, 使得国内的用户心里产生各种复杂感受的, 另外还有的就是GLM - 5.2。

按开发者小薇所讲, GLM - 5.2的套餐近乎没有, 即便有套餐在高峰期依旧会限流, 况且存在“背刺”用户的情况。

依照36氪所做的报道, GLM - 5.2的套餐, 先前状况是比演唱会门票更为难抢到, 每日早晨十点钟会准时进行刷新, 能否买到完全取决于手速。

2026年1月的时候, 智谱发布了公告, 公告表明由于算力处于紧张状态, 所以将每日能够销售的量做了一下子下调, 直接削减到原本的20%, 每天早上10点的时候会放出一小点额度, 并且在几分钟之内就会被销售一空。

究其根本而言, 国产的模型, 于套餐方面以及价格上面所呈现出的那种“吝啬”状况, 从本质上来说, 是因为算力不足, 进而导致了窘迫的局面。

参考2025年, 中国信通院以及工信部给出的数据来看, 现存于中国的数据中心数量是449个, 然而美国的数据中心数量却是5427个, 在总算力这一方面, 中国的算力数值为1053, 可是美国的算力数值却是2400。

只是这里的关键之处就在于, 美国的那两千四百, 高端GPU所占的比例是非常高的。而中国的算力当中, 有着大量的是华为昇腾、寒武纪等国产芯片, 单卡的性能跟H100仍然存在着代差。

开始于2026年3月, 为应对那愈发高涨起来的算力需求, 智谱、阿里云、腾讯云、百度在Token价格方面集体进行涨价, 其涨幅处于从5%到460%这个范围之内, 均不相同。

说白了,国产模型的“低价”、“价格战”早已成为了过去式。

不是国产模型不想去搞, 而是因为已经算过账了, 以当下的算力成本以及亏损状态来看, 搞包月就如同拿固定月费去赌用户不会刷爆, 然而按照国内开发者、程序员那种动辄一天烧几十亿、甚至上百亿Token的用法, 如此的商业模式, 很快就会被击穿成本线。

可是的编程套餐, 面向的是高净值企业客户, 也就是那种大客户, 一年对能贡献14亿美元收入。

这套商业模式, 在高算力予以加持的状况下, 其本质是通过“固定月费”来换取“长期锁客”, 客户具备较高质量, 并且ARPU相对而言也较高, 能够摊平成本。

然而相比较而言, 在国内, 尽管存在像阿里这般的云领域巨头, 可问题在于, 阿里云进行调整后, 其EBITA仅仅只有7.5%, 云智能集团虽说收入增长速度较快, 然而利润并非丰厚。

而, 传统云厂商敢于售卖“不限量云服务器”, 缘由在于用户并非全天候处于满负载状态。就一台 ECS 而言, 其实际 CPU 利用率或许仅为 10%, 云厂商能够将一台物理机超额卖给十个人。

但大模型的推理情况有所不同而来一个token, 即必须实实在在烧掉一次GPU算力, 要是用户整日毫不停歇地进行刷新, 那么云厂商那方面的HBM显存, 它的GPU核心以及电费, 全部是刚性支出, 没有任何超卖的空间。

03模型的“黄金三角”

于国内开发者而言, 除涉及价格之因素外, 选择Codex、Code的缘由, 无疑是其具备强大的编程性能。

然而,在性能方面,国产模型也并非像某些刻板印象中想的那样。

笔者在同多数开发者进行交流沟通之后, 察觉到一种相当普遍存在的看法是, 具有本国特色的大型模型, 特别是好比GLM - 5.2这般较新出现的模型, 如今已然能够承担某些有助于做铺垫的、处于次要地位的任务, 像开展测试工作以及修正程序中所出现的漏洞等。

然而, 在那些更为繁琐的、历经较长时长的异步任务方面, 国产类模型当前和诸如GPT等处在顶尖位置的模型相比较的话, 依然存有较大的距离。

从事开发工作的小张, 在今年3月的时候, 有过一回使用国产模型来进行编程的经历, 拿GLM、qwen跟GPT针对同样的任务做对比, 结果只有gpt完成了运行, 并且符合页面所提出的要求, 然而这可是个具备多级、多列内容比对以及结果生成的项目。

有另一位开发者小薇称, 按照她的体验来讲, Kimi 2.7的性能还行, 豆包2.1 Pro的性能也还行, 然而将其进行综合的话, 它在整体性能表现层面, 总体是属于弱一个档次的那种情况(处于第二梯队范围内), 可即便如此, 其最终的总体性能表现, 也超过了4.6了。

当下, 在开发者群体里头, 普遍存在的一种共识是, GLM - 5.2是首个达成了Opus级别的国产模型。

在它执行那种真实的任务时, 那种复杂的任务时, 那种长时间的异步任务时, 它是可用的, 它占据了一席之地。

它, 在好多维度, 就像世界知识这个维度, 跟真正的Opus模型相比, 还是有着比较大的差距, 可是、这并不影响它变成国产模型里的新高度。

然而实际情况是, 那些方才开始显露头角的, 为数眇少的“尖子生”, 却遭受了和性能没有关联的别的因素的拖累。

详细来讲, 这般的因素涵盖了缓存效率欠佳, 在高峰期依旧会实施限流等情况, 致使开发者的实际体验极为糟糕。

这就引出了当下模型对比中的另一个维度:稳定性。

针对一线开发者以及程序员的体验而言, 模型的择选, 已然不是单纯的性能比较, 而是——。

性能—价格—稳定性的“黄金三角”。

在这三个维度中,国产模型只勉强拿下了第一维度的部分指标。

最近这段时间, 在国内的Kimi推出了它最新的旗舰模型K3 , 这是一款怀揣着2.8万亿参数的模型, 它具备原生多模态的特性, 并且有着100万Token上下文, 该模型属于开放权重旗舰模型, 它主要致力于长程编程、知识工作以及深度推理。

图片

在好些测评里头, 它于某方面的智力指数为57分, 在全球排第三;在Arena前端编程榜单上, 它凭借1679分拔得头筹, 甚至有传闻讲, 它的性能已经能够比得上Fable 5了。

然而, 在那耀眼明亮的分数跟排名的背后之处, 开发者所关切在意最多的, 依旧仍旧还是一个词语: 性价比。

K3发布之后, 不少开发者讲, 当下Kimi依然价钱高, 跟Codex比起来不存在性价比, 并且额度不够用, 单瞧API价格, K3也算不上“白菜价”: 每百万Token缓存是2元, 输入是20元, 输出是100元;GPT - 5.6 Sol是0.5美元、5美元、30美元, K3虽比Sol低, 然而显著高于GPT - 5.6 Luna的0.1美元、1美元、6美元。

并且, 于使用K3期间, 开发者称, 还发生了API断连的状况, 甚至, 断连持续了一整个上午, 有这样的情形。

就当下情形而言, 国内开发者并非是不想为国产模型掏钱付费, 而是国产模型当前由于算力的紧张状况以及成本的高昂程度, 当下没法开出像Codex那般具备性价比的套餐, 仅仅能够推出那种表面看似属自助餐, 然而实际上却是有数量限制的“大众点评套餐”(类似于智谱的Plan)。

套餐体验存在稳定性不足的状况, 性价比也处于模糊不清的模样, 致使使用过后的用户难以留存下来。在目前算力底座成本高昂的此种情形下, 这样的状况从本质意义来说, 正是用户基于理性所做出的选择。

以上所述种种, 并不是我们要去将别人的气势无端增长,把自身的威风无故消解, 仅仅只是期望去通报一种存在的风险。

当下, 国产模型于追赶GPT的进程里, 很是热衷于突出高性能, 可国产大模型自开展研发直至投入应用, 所要攀爬的峰峦, 决然不只是性能这一项艰巨挑战呀。

我们所需求的是等待, 待国产算力基座实现大规模量产, 于技术、价格以及稳定性这些方面, 达成合力, 如此我们的产品方可撑得起用户的期待。