AI基础设施、芯片和机器人 80张游戏卡跑2.8T参数Kimi k3:不用HBM芯片,普通网线就搞定 #本地小语言模型 #AI基础设施 #AI人工智能指南 #DeepSeek时刻 2026-07-28 1 3K banq
80张显卡跑Kimi k3本地大模型!Kimi K3这个庞然大物有2.8万亿个参数,居然只用游戏显卡和普通网线就跑了起来:80张RTX 5090联手干活,每秒吐20个词。

这等于把超级计算机的门槛踹碎了,任何实验室、初创公司甚至大学都能上手把玩。

开放权重模型第一次摆脱了昂贵的HBM芯片的绑架,只用GDDR7显存和MXFP4压缩格式就实现了前沿智能。

参数巨人闯进游戏厅

2.8万亿个参数挤在80张游戏显卡里。每个参数就是一个数值,代表模型学到的某个知识点。

2.8万亿这个数字大得离谱,相当于把全世界图书馆的每本书都拆成几百万个小点。每个小点都得存进显存里,还得在显卡之间飞快传递。

RTX 5090这张游戏卡本来设计给打游戏用的,显存带宽够猛但容量有限。单张卡装不下整个模型,只能把参数切开分给80张卡。每张卡负责一块,像拼图一样合体干活。

模型运行时每秒处理20个词元。词元token就是模型看到的最小文字单位,可能是一个汉字也可能是一个英文单词片段。

20 tok/s的速度跟人正常说话差不多,机器对话时你不会觉得它卡顿。第一天跑起来就有这个成绩,还没做任何优化。

这就像新车刚落地就跑了100码,后续调校一下还能更快。这个团队上周刚把GLM-5.2的速率从30 tok/s拉到110 tok/s,证明这套优化手法很熟练。

普通网线拉起的超级战队

80张显卡靠25GbE以太网串联。以太网就是平常电脑上网用的那种网线协议,25GbE每秒能传25G比特的数据。显卡之间需要频繁交换参数更新和计算结果,网络就是它们的对话通道。通道够宽,对话才流畅。团队没用那些昂贵的高速专用网络,就拿普通机房里的以太网设备。

HBM是高端AI芯片上贴的一种超高速显存,产能少价格贵。GDDR7就是游戏显卡上用的显存,产量大得多。官方发布的MXFP4权重是一种压缩格式,把原本占地方的参数压扁了塞进显存。没有重新量化意味着直接用官方压缩版,没做二次处理。这一步省了大量计算时间,也证明官方压缩质量过硬。

开放模型摘下昂贵皇冠

开放权重模型就是模型文件公开下载,谁都能拿到源代码和参数。Kimi K3属于这种类型,以前要跑这么大的开放模型基本依赖HBM芯片。现在用游戏卡就能跑,等于把运行成本打到了地板价。任何实验室只要凑够80张5090就能拥有这个级别的智能体。

实验室就是大学或公司里的研究部门,通常预算有限。初创公司刚成立没什么钱,大学课题组靠科研经费过活。它们之前想玩大模型只能租云服务,按小时付钱贵得肉疼。现在能自己买卡搭服务器,长期看省太多。微调就是拿通用模型在特定数据上再训练一下,让模型更懂某个专业领域。代理就是让模型自主执行任务,比如帮你订票查资料。

显卡越多麻烦越堆

80张RTX 5090的采购价大概400万人民币左右。每张卡功耗有500多瓦,80张同时跑起来等于开了40个电磁炉。电路改造先得搞定,普通办公室的墙插直接跳闸。散热系统得跟上,否则显卡高温降频速度就掉了。机架空间也要规划,80张卡得塞进好几个服务器机箱。

25GbE网卡和交换机也得花钱。虽然比专用网络便宜,但整套基础设施下来又是一大笔。普通以太网有延迟,显卡之间同步数据时会有等待时间。模型分到80张卡上,每张卡算完自己的部分要等别人结果汇总。同步等待的时间越长,整体速度越慢。20 tok/s的速度看着还行,但如果网络再快点可能冲到更高。

省钱方案背后的尴尬

有人算过账,买8台GB200服务器价格差不多480万。GB200是英伟达的企业级AI服务器,自带HBM和高速互联。虽然贵一点但集成度高,插电就能跑不用折腾。80张5090还得自己配主板电源网线散热,组装调试费时费力。对于不差钱的大公司,直接买整机省心得多。

Mac Studio这种苹果电脑也能跑模型,4台的价格比80张5090便宜。但速度掉到只有3 tok/s,打一句话等好几秒。这个速度在聊天场景里能急死人,对话节奏全断了。团队说普通用户也能搞,但真让个人掏几十万买卡不现实。个人玩家最多买两张卡跑跑小模型,80张那是小型数据中心的配置。

游戏卡逆袭背后的行业地震

GDDR7显存产能比HBM大太多。全球能造HBM的工厂就那么几家,订单排到几年后。GDDR7的生产线成熟多了,供应量充足价格也亲民。这次成功意味着模型运行不再被稀缺芯片卡脖子。之前很多团队因为买不到HBM只能干瞪眼,现在多了一条路。

MXFP4压缩格式把模型体积缩到了原来的四分之一左右。2.8T参数如果全精度存储需要11TB显存,压缩后只要1.5TB。80张5090每张24GB显存,合计1920GB,刚好装下还有余量给上下文。上下文就是对话时的历史记录,模型需要记住之前说过什么。余量越大能聊的天就越长。

普通网线跑赢专用高速

25GbE以太网在数据中心里算中等速度。专用网络像InfiniBand能跑到400GbE,但设备贵得离谱。团队选25GbE明显在成本和性能之间找了平衡点。上周他们优化GLM-5.2的网络配置把速率翻了三倍多,说明软件层面的调优空间很大。这次Kimi K3才第一天跑,后续压榨潜力还多得很。

网络速度影响模型推理时的通信开销。每生成一个词元,80张卡要来回传数据好几轮。如果网速慢,显卡大部分时间在等数据而不是计算。25GbE目前够用不代表最优,升级到100GbE可能让20 tok/s变成40 tok/s。但这种升级又要换交换机网卡,成本跟着涨。

每个实验室都能拥有的超级大脑

开放权重模型的魅力在于透明可复现。Kimi K3的每个参数都公开,研究者能拆开看里面怎么工作。商业模型只给API接口,里面怎么算的全黑盒。实验室要发论文必须深入分析模型内部机制,开放权重是刚需。以前只能分析小模型,现在大模型也敞开了。

大学教学时可以直接拿Kimi K3当案例。学生看着2.8T参数的模型在普通硬件上跑,理解更直观。初创公司拿它做垂直领域微调,不用从零训练省下几千万。微调只需要在已有模型上继续学新数据,算力成本降了几个数量级。代理应用比如自动写代码、整理文档,都能基于这个底座搭建。

80张5090跑起2.8T模型这事,等于告诉全世界超级智能的门槛被踹开了。你不需要HBM那种金贵芯片,游戏卡加普通网线就能上手。

那天晚上我在想,要是学校机房当年有这配置,我逃课打游戏的借口都得换一个——现在得说我去跑模型了。跑模型可比打游戏费电多了。

原文期刊:Reddit r/LocalLLaMA / 发表日期:2026-07-28 / 原文标题:A user has managed to run Kimi K3 on 80xRTX 5090, via 25GbE Ethernet/