
自Kimi K3开放源代码之后, “进行大模型的布置动作”一下子变成了网络上热烈讨论的主题。
全球性能第三,免费下载。这谁看了能不心动?
然而按照在网络上传播范围最为广泛的那种说法来讲, 要是想依靠自身去搞定K3的话, 大概是需要3000万人民币去购置设备的毕竟啊, K3的总参数为2.8万亿, 仅仅是权重文件就达到了1.4TB至1.5TB这个范围, 而实际所需要的显存更是超过了2TB。
所以, Kimi官方所给出的建议是, 起码得有一个具备64张加速卡的超节点, 才能够自行部署Kimi K3。依照当下的主力型号B200来计算, 一张卡大约是40万人民币, 64张光显卡价值就是2560万。普通居民楼的地板没办法承受如此重的设备, 还得考虑专门建造一个机房, 并且还要加上设备运作以及配套液冷设备所产生的电费。这么去说吧, 要是你真的下定决心自己去跑Kimi K3, 前期投入起码得有两辆劳斯莱斯幻影。
即便你神通广大, 真的能够独自处理搞定所有设备, 可想亲自开展布署Kimi K3同样绝非轻而易举的事情, 因为接踵而至摆在后面的, 还有电费支出, 散热问题, 模型优化微调, 运维管理等等一系列事项, 每一项都堪称为一笔数额不小的花费开销。
此外, 除开K3, 国产开源大模型存在诸多, 像V4-Pro、GLM-5.2、Qwen 3.8, 每一个皆是千亿乃至万亿参数等级的参与者。那么它们的部署所需成本又是多少呢?
01
开源大模型到底有多大?
实际上, “普通人想要自己去跑大模型”此事, 并非是最近才出现的情况。仅仅是由于K3太过具有广泛影响力, 才又一次经由各大媒体平台再次被提及罢了。
早在V3发布的那个时候, 就已然存在诸多的人, 针对普通人怎么样去推进模型的相关部署展开了讨论。
将时间定在2024年年底, V3凭借着拥有6710亿总参数、370亿激活参数的MoE架构进行开源, 在此之下其训练成本仅仅为557万美元。然而, 即使成本低廉, V3的性能还是能够比肩3.5。
短时间之内, 在知乎之上, 于 B 站里面, 处在公众号之中, 到处都是“手把手教你本地部署 V3”这类的教程。

有的人拿着RTX 4090去硬扛, 有的人让家里的电表跑到跳闸, 甚至还有对技术不熟悉的七大姑八大姨, 都在问“是什么, 怎么用”。
那情形, 恰似往昔比特币行情开端之际, 所有人都在谈论怎样借由笔记本开展挖矿操作。
不过呢, 虽说热闹是热闹得很, 然而一旦要是想将V3完整地运行起来, 那推荐的配置可是8张H100或者A100。H100单卡着官方所定的价格是3.65万美元, 换算成人民币大约是26万, A100相对便宜一些, 单卡大概是10.8万人民币, 8张卡组成的整机价格也要80万往上。需要清楚的是, 高配版的宝马X5、奔驰GLE、奥迪Q7, 落地也才仅仅70多万。
还有, 网上那些被称作“RTX 4090做本地部署”的教程了, 运行的是已经量化变得到面无全人的4位精度的一个阉割版本儿了。输出的答案不但质量低, 并且还有严苛的字数限制, 一旦超出几百个字, 模型就会一下子崩溃。
普通人跟千亿参数之间存在着差距, 这个差距可比教程当中所写的“5分钟搞定”要长得很多, 遥远得很多。
到了2026年,局面就更夸张了。
在2026年4月24日被发布的V4-Pro, 总体参数为1.6万亿, 基于MIT协议实施开源, 其权重被放置于Face上可供免费下载。
即便采用FP8精度进行量化, 权重文件起始就得达到1.6TB, 不然的话, 要将其完整地装入显存, 起码得需要16张H200才行, 这儿的H200单卡拥有141GB显存, 16张加起来总共是2.2TB, 把KV缓存以及系统开销扣除之后, 恰好使用。
英伟达的H200, 其官方定价是单颗2.7万美元, 折合人民币大约是19万, 然而国内给出的报价是23.5万, 一张卡如此报价, 8卡的整机报价为188万, 16张卡的话那报价就是376万。
再瞧2026年6月17日智谱开源的GLM - 5.2, 其总参数大概约7530亿, 激活参数更是小些, 同样只需8张H200便能够运行起来。
之后是Qwen 3.8。2026 年 7 月 19 日, 阿里发出预览版, 此者总计参数为 2.4 万亿, 并且承诺很快就会开放权重。
2.4万亿参数要完整装下, H200, 其141GB显存已然不够看啦, 得更换为B200才行, B200单卡有192GB显存, 64张B200加起来合计是12.3TB, 如此这般才能撑住这个参数体量。也就是说, 若想要部署Qwen 3.8, 也同前面提及的K3那样, 需要去准备3000万。
可是事情到这里并没有结束, 甚至可以说它才刚刚拉开帷幕, 显卡仅仅是其中的第一笔支出, 紧接着就是电费账单的问题。
以Qwen 3.8的那用于示例的64张B200来说, B200单卡的TDP是1000W, 而液冷版的能够拉到1200W , 64张卡处于满载状态就是64千瓦到77千瓦范围, 再加上诸如CPU、网络交换机、散热泵等周边设备产生的功耗, 整机柜很容易就突破80千瓦。
1.5匹用于家庭的空调, 其制热功率大概约为1200W , 一张B200差不多快要赶上一台这样的空调了。64张B200处于满载运行状态 , 这等同于同时开启50多台此类空调 , 其用电量能够抵得上半栋居民楼的用电量。
按照工业用电每度0.8元来算, 80千瓦处于满载运行状态, 那么每天的电费就是1536元, 一年算下来就是56万。而且这还是在不停机的情形之下, 大模型推理服务器一旦上线, 基本上便是7×24小时持续运转着, 不存在“关机省电”这样一个选项哒。
电的问题说完了,热的问题紧跟而来。
B200单卡有着1000W的功耗, 这表明传统的风冷散热根本无法压制住。
英伟达官方宣称, B200的SXM版本自设计初始便致力于液冷方向,风冷版本存有性能上限, 液冷版本方才能够达到。
有液冷设备, 它能细分成两类, 其一为经英伟达认证的, 在市场上对应每一机柜的定价大致是十五万至二十万人民币, 其二乃未经英伟达认证的, 差不多每机柜价格处于八万至十五万。
空间同样是个问题, 有一台属于标准类型的8卡HGX服务器, 其高度处于6U至8U的范围, U是针对机架单元所设定的标准, 1U的具体长度是44.45毫米, 所以该服务器的高度能够被理解为是0.267米至0.356米。
紧接着, 裸机一般情况下重量在75至120公斤之间, 以满配状态, 带着导轨、线缆以及PDU, 整体机器常常超过90公斤。然而, 一个机柜的底座面积是比较小的, 通常是0.36平方米。平常住宅的均匀活荷载是每平方米200公斤, 这就表明了, 一个机柜的局部压强, 明显高于民用常规设计, 所以是没办法放置进普通住宅里面的。
此外, 这种设备对于环境温度有着严格要求, 对于环境湿度有着严格要求, 对于环境灰尘也有着严格要求, 要是没办法进行严格的管控, 就会出现这样那样的风险, 此处所举例子包括冷却液外漏等风险。
最后还有运维。大模型部署不是“装个软件”这么简单。
加载模型权重, 对推理框架进行调优, 配置KV缓存策略, 实施监控告警, 排查日志问题, 进行故障恢复, 这当中的每个环节都需要专业工程师的参与, 至少得要有一个由三到五人所组成的小团队才行。按照当前的行情来看, 一名合格的AI基础设施工程师, 其年薪起码是从30万开始起算的, 那这样一个小团队, 一年的人力成本将会超过百万。
02
钱不能解决所有问题
价格只是一方面,接下来这些,才是真正让人感到无力的部分。
英伟达的高端卡对中国有出口管制,这不是什么新闻了。
美国工业与安全局, 也即BIS, 做出明确规定, 基于架构的B200芯片, 还有B300芯片, 以及下一代的Rubin系列芯片, 在国内发布之后, 至少在18到24个月这个时间段内, 仍然要严格禁止向中国出口。
还好的是, 鉴于咱们仅仅是运用模型运行, 而非去训练大模型, 故而只需考量GPU的推理能力便可, 而至于推理此项工作, 国产AI芯片照样也能够加以完成。
可是, 事情又得翻过来讲了, 有具备运行起来的能力, 这是一方面;然而, 好不好使, 这那却又是另外一方面的情况。英伟达的CUDA生态历经十五年沉淀聚集, 在全球范围内有着数百万计这样数量的开发者, 在Stack之上依照标准顺序能找寻到的解答, 就像广阔无边的大海里的水那么多, 数也数不清。
然而在国产AI芯片这儿, 虽说V4达成了全栈国产化训练, 八大国产芯片厂商均进行了Day 0适配, Kimi也宣称在将来能够运行于国产卡上, 可这是关乎Kimi官方团队的工程能力。
你身为民间玩家, 拿到了国产卡, 然而在CUDA上一天就能成功运行出来的内容, 换做国产卡的话, 就需要一等儿比较长的时间, 才能获得适配, 一旦出现报错情况, 你是不具备能够于Stack上去寻觅答案的条件的。
软件生态方面存在的差距, 相较于硬件性能所存在的差距而言, 更会使得人陷入绝望的境地。硬件运行速度缓慢的话, 你是能够去等待的;然而软件要是无法正常运行, 那你就连等待的资格都不会拥有了。
就算退一万步来讲, 哪怕你行事风格大胆, 弄到了卡, 处理好了液冷相关问题, 承受住了电费开支, 维持起了团队运作, 让模型得以运行起来, 那又能产生怎样的结果呢?
如果你拿着这一套物件去跟官方应用程序编程接口作比较, 那么你就会发觉, 那百分之九十九的公司自行建造的话, 永远都无法收回成本来。
我们拿 V4-Pro的最低配方案来算一笔账。
V4 - Pro的API定价, 其输入方面, 每百万token是3元, 不过要是缓存命中的话, 仅仅只有0.025元, 在输出方面, 每百万token为6元, 并且它还首次开创了“峰谷分时计费”, 在谷时的时候, 算力费直接降低了60%。
不计峰谷差价, 假定你团队每日动用5000万token, 当中输入3500万, 输出1500万, 这已然是颇为高频的使用量了。
费用输入是, 35乘以3等于105元每天, 费用输出是, 15乘以6等于90元每天, 每天总计不到200元, 一年大约7万。
前面讲过, 16张H200光学显卡就是376一万, 再加上液冷改造30一万、电力增容以及场地改造30一万, 硬件首年投入约436一万。
又算运维这块, 有个小团队, 每年人力花费达百万, 电费方面, 以16张已满载的H200来计算, 大概是11.2千瓦, 24小时都在运转, 对于整台服务器而言, 还得算上CPU 内存 硬盘以及风扇这些, 加上这个数据中心的PUE, 实际所取电的功耗大概处于15至20千瓦左右, 按照工业用电1元每度来算, 一年的电费应当处在13万到18万之间。
这意味着, 不算硬件折旧的情况下, 仅仅是“养”这样一套系统, 每年就要花费掉120多万, 硬件要按照5年进行折旧, 总计自建设立每年成本大于200万。
作者声明:该图片由AI生成

大模型推理成本的关键逻辑在于, 模型规模一旦越大, 那么推理费用就会越贵, 可是, API厂商凭借规模效应来摊薄成本的能力, 要远远超过任何单独的一个企业。
Kimi、阿里等这些厂商, 在一张GPU上, 跑着几百个用户的请求, 这里有批处理技术, 还有KV缓存复用技术, 也有投机解码技术, 更有动态路由技术, 每一项技术都在竭尽全力地榨干每一滴算力。
在缓存命中率超过百分之九十的情况下, Kimi K3命中后输入成本仅为标准价的四分之一。倘若自身进行部署, 一张卡只为一个用户提供服务, GPU利用率或许连百分之十都难以达到。
老老实实用API,不丢人。
03
你下载的模型和官方的模型是两回事
哪怕你行事风格大胆, 弄来了全部所需的设备, 并且你熬了好几个通宵, 最终成功地在你自身的设备上安置了欲求的大模型。
那, 恭喜你, 你所跑出来的那个事物, 与官方API当中的那个事物, 根本就不是同一类物种。
为什么?因为你能下载到的,只是权重文件。
模型所拥有的“记忆”体现在权重文件上, 模型于训练进程当中所学到的全部内容, 诸如语言规律, 知识, 逻辑, 甚至在一定意义上的“常识”, 皆作为数字形态而存在于这些权重之内。
然而, 模型权重并非是一个数据库, 它乃是大模型理解问题所采取的方式, 其有助于你领悟模型权重可被当作是一个“分量”。
对于一张照片内是否为猫的判断方式, 会涉及到对脸部的观察查看, 以及对是否存在胡子的考量, 还有对身上毛发状况的留意, 另外有无尾巴也是一个判断要点……
脸最为关键, 猫科动物的脸看上去大致相像, 只是有无尾巴以及有无毛就并非那般关键, 好多动物都具备尾巴和毛。
不同特征的重要程度(权重)就是它在大模型中的分量。
然而, 有一个模型, 由“权重文件”转变成为“好用的AI服务”, 在此过程当中, 隔着一整套工程, 而这一整套工程你是没办法拿到的。
首先是推理优化框架。
官方进行跑投机来解码, 依赖半自回归生成以及置信度调度为之验证, 于不造成质量损耗的状况下, 使推理速度得以提升, 有了51%至85%的增幅;Kimi具备自行研究的架构, 这架构是分离式推理的那种。
这些框架针对模型的结构展开了深度具备定制性质的优化, 清楚知晓哪一个专家应当迈入哪一条路径, 哪一层能够实施算子融合, 哪些计算能够予以跳过。
你所拿到的权重文件, 仅仅只是一个“裸”的模型,这款模型的性能与官方的相比, 差出一个数量级, 这都并不稀奇。
然后是KV缓存策略。
大模型生成每一个字的时候, 都得将前面出现的所有内容再度进行“理解”, 而这个处于中间阶段所形成的结果就被称作KV缓存。
官方服务会对这些缓存加以管理, 比如说, 要是有多个用户问了相似的问题, 那么这些缓存便能够复用;对于高频请求的内容, 缓存会提前进行预热;当内存紧张的时候, 哪些缓存应当淘汰、哪些应该保留, 全都存在精细的路由算法。
Kimi K3借助缓存命中, 其命中率高于90%, 命中之后输入成本径直降至标准价的四分之一。
你自己跑,没有这套缓存策略,每个请求都从零开始算,慢且贵。
还有动态批处理。
由官方服务进行处理时, 会将不同用户所发出的请求, 依据动态情况打包成为一个batch, 此batch会被一次性投递给GPU来予以处理, 在这个过程当中, GPU的并行计算能力被充分地压榨至极致状态。而要是你自己单独一人使用, 每一次仅仅只有一个请求, 如此一来, GPU高达99%的算力便处于空转的情形之中了。
这就如同你购置了一辆大巴车, 然而仅仅只有你自己乘坐, 油的花费一点都不会少, 座位却空余了95%。
用于推理优化的内容, 以及KV缓存策略, 还有动态批处理, 包括路由算法, 这些切实对体验起着决定作用的事物全部都是闭源的。
好比餐厅给了你菜谱, 菜谱上面写明了要用怎样分量的盐, 要放多少多少的酱油, 该以几成的热油下锅, 假如你依照着去做, 是能够做出一盘可以用来吃的菜品。
作者声明:该图片由AI生成

且不说其他方面, 可口可乐的配料是写在瓶子上的, 试问哪个人, 能够拍着胸脯表明, 它能够处于可口可乐相应价格的范围之内, 严丝合缝精准地复刻出可口可乐具有的味道呢?
那个模型也是这样的情况。自己所下载获得的权重, 以及在官方API里运行的那个模型, 尽管二者参数是完全一样的, 然而背后的推理框架不同, 缓存策略不一样, 批处理被优化的程度不一样, 路由调度也相差甚远。当你向它询问相同的一个问题时, 官方给出的回答速度快且质量好, 而你得到的回答速度慢同时还存在幻觉。
所以,得稍微掂量掂量自己的实力再考虑部署。
倘若身为企业, 存在数据合规方面的需求, 具备数据安全方面的要求, 拥有定制化微调的需要, 那么确实存在自建的理由, 然而那属于企业级别之事, 有特别的团队, 有专门用作此事的预算, 还有特定的机房。
倘若仅仅是身为普通老百姓,瞅见开源模型能够免费下载便怦然心动了, 进而萌生了想要在家中弄一套“属于自己的 AI”的想法。那么我认为还是打消这个念头为好。
只需花99块钱, 仅仅需要一个月, 购买具备特定级别的Kimi订阅, 便能够使用全球排名第三的模型。
开源是好事,但开源不等于“免费部署”。
从入门到放弃,这才是老百姓部署开源大模型的真实距离。