2.8万亿参数的模型跑在了8GB内存的电脑上:AI的「平民化时刻」真的来了
2026/8/3 19:37:12 · 来源
有人用纯C代码,把需要数据中心才能跑的万亿参数模型,塞进了一台笔记本。
2026年8月1日,GitHub上出现了一个仓库:kimi-k3-in-c。
点进去,你会看到一行让人怀疑人生的数据:
2.78T 参数 | 1.56 TB 权重 | 8.24 GB 内存 | 176 KB 引擎 | 0 GPU
2.78万亿参数的模型。纯C99代码。没有BLAS,没有PyTorch,没有GPU。176KB的引擎代码,跑在8GB内存的笔记本上。而且给出的答案是正确的——“法国的首都是巴黎”,一个字都没错。
这个项目在两天内冲到了400个star。
另一条战线上,一个开发者也用完全不同的方式把同一个模型塞进了消费级硬件:sqliteai/waste 项目用NVMe流式加载的方式,在64GB的MacBook Pro上运行了完整的Kimi K3。速度不快——每秒0.45个token——但它在跑。完整的、没有蒸馏、没有裁剪的2.8万亿参数模型。
几个月前,跑这种规模的模型还需要GPU集群和几TB的显存。现在,一台笔记本就够了。这不只是一次技术展示——它预示着大模型运行门槛正在经历一场剧烈的塌缩。
为什么万亿参数能塞进8GB?
答案藏在三个技术细节里。
第一个:MoE 只激活4%的参数。 Kimi K3 是一个混合专家(Mixture-of-Experts)模型。2.8万亿参数里有896个专家,但每次推理只激活其中16个。这意味着模型虽然巨大,但每次处理一个token时,实际参与计算的参数只有总量的约4%。大部分参数在大部分时间里都"沉睡"着。
第二个:MXFP4 量化。 传统模型用16位或32位浮点数存储权重。Kimi K3 的权重被压缩到了4位(MXFP4)。1.56TB的原始权重,在kimi-k3-in-c的实现里被压到了可以流式读取的规模。176KB的引擎代码负责管理这一切——它本质上是一个精密的调度器,决定哪些专家需要从磁盘加载到内存,哪些可以继续沉睡。
第三个:线性注意力把 KV Cache 缩小了50倍。 传统 Transformer 在处理长上下文时,KV Cache 会随上下文长度线性增长。4K上下文需要11.25GB的 KV Cache。Kimi K3 用 Kimi Delta Attention(KDA)把 KV Cache 压缩到了0.21GB。少了50倍。这让它能在有限内存里处理更长的文本。
三个技术叠加在一起,创造了kimi-k3-in-c的核心魔力:同一个模型,8GB能跑,224GB也能跑,输出完全一致。 区别只在于速度——8GB版本需要从磁盘流式加载专家,慢;224GB版本把所有专家都放在内存里,快。但答案一个字都不差。
这不是蒸馏版,是完整版
最容易产生的误解是:这是不是把大模型蒸馏成了一个小模型?
不是。
kimi-k3-in-c 的 README 写得很明确:“This is the full model, not a distilled or pruned version.” 它跑的是完整的2.78万亿参数模型,1.42TB的原始权重一个不少。
区别在于运行方式。传统方式是把整个模型加载到显存里,然后做矩阵运算。kimi-k3-in-c 的方式是:把模型的"共享部分"(dense trunk)放在内存里,把1.45TB的路由专家直接从磁盘的4位压缩格式里"乘出来"。专家不需要先解压再计算,而是在压缩状态下直接参与运算。
这就像你不需要把整个图书馆搬回家,只需要记住书架的布局,想看哪本书就去图书馆借,看完放回去。kimi-k3-in-c 的作者 FareedKhan 在README里展示了这个流程:一个密集的共享层驻留在内存中,负责理解上下文和做出路由决策;真正干活的专家层则按需从磁盘加载。整个引擎只有176KB,比一张手机照片还小,却能调度1.56TB的万亿参数模型。这种设计的优雅之处在于,它把调度和计算完全分离了。调度器极小极快,计算层极重极慢,但通过精确的预读和缓存策略,系统能在两者之间取得平衡。
Kimi K3 本身是什么来头?
如果只是"有人把大模型跑在了小机器上",这个故事还不够完整。真正让这件事有意义的,是 Kimi K3 本身。
月之暗面(MoonshotAI)在2026年7月底开源了 Kimi K3,定位是"Open Frontier Intelligence"。官方仓库已有近8000个star。
Kimi K3 的几个关键参数:
-
2.8万亿参数,896个专家,每次激活16个
-
原生多模态(文本+视觉)
-
100万 token 上下文窗口
-
基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)架构
-
世界首个开源3万亿级别模型
K3 的设计目标不是"最大",而是"最实用"。它能进行长时段编程——在最少人工干预的情况下,持续处理大规模代码仓库,调度终端工具,从GPU内核优化到芯片设计都能做。它能做端到端的知识工作——深度研究、交互式可视化、仪表盘生成、运动设计和视频编辑。
当这样的模型被社区开发者用纯C代码跑在笔记本上时,意义就完全不同了。它证明了:前沿AI能力不再是大公司的专属。一个有技术热情的开发者,用最朴素的工具链,就能让最先进的模型在最普通的硬件上运行。这种反差本身就是最好的故事。
从集群到笔记本:发生了什么?
回顾过去一年,大模型的运行门槛下降得惊人:
-
2024年初:跑70B模型需要至少一张A100(80GB显存)
-
2024年中:量化技术让70B模型可以在24GB显存的消费级显卡上跑
-
2025年初:DeepSeek V3 的 MoE 架构大幅降低了激活参数量
-
2025年中:Kimi K2 让万亿参数模型在多GPU工作站上成为可能
-
2026年8月:Kimi K3 被社区开发者塞进了8GB内存的笔记本
每次门槛降低,都会释放一波新的可能性。当70B模型可以在消费级显卡上跑时,独立开发者开始做本地AI应用。当万亿参数模型可以在笔记本上跑时,会发生什么?
可能的变化:
- AI 开发不再是大公司的专利。 一个独立开发者、一台笔记本、一个下午,就能测试一个万亿参数模型的能力。
- 数据隐私问题大幅缓解。 你的数据不需要上传到任何云端,在本地跑完就结束。
- 新兴市场的AI创业门槛降到接近零。 在电力和网络都不稳定的地区,笔记本上的AI模型可能是唯一的智能来源。
速度的代价
公平地说,kimi-k3-in-c 的速度目前还很慢。
在8GB内存的配置下,生成8个token需要261秒,平均每个token 32秒。这比打字还慢。在128GB内存的服务器配置下,28个token 需要300秒,平均每个token 10秒。
sqliteai/waste 在64GB MacBook Pro 上的速度是0.45-0.62 tok/s,大约每秒1-2个词。可以用来测试模型能力,但还不适合实时交互。
不过,这只是第一版。2024年初的 llama.cpp 在CPU上跑70B模型时,速度也只有每秒0.5个token。一年后,同样的硬件已经能跑到每秒5-10个token。kimi-k3-in-c 的优化空间巨大——SIMD向量化、批处理优化、更激进的内存管理,每一步都可能带来数量级的提升。而且kimi-k3-in-c 已经支持AVX2指令集和SIMD优化,作者在架构设计上预留了大量优化空间。随着社区贡献者的加入,性能曲线很可能在未来几个月内陡峭上升。另一个值得关注的方向是 sqliteai/waste 项目——它用NVMe流式加载的方式解决了内存瓶颈,把模型存放在SSD上,按需加载专家。这种思路对于没有足够内存的设备特别有价值,也为未来在手机或嵌入式设备上运行大模型铺了路。
这对AI行业意味着什么?
Kimi K3 在单CPU上跑起来,不只是一个技术演示。它传递了一个信号:大模型的部署门槛正在以指数级速度下降。
当运行门槛下降,会发生三件事:
第一,竞争格局改变。 以前只有大公司能负担得起训练和部署大模型的算力。现在,独立开发者可以在自己的笔记本上评估、测试、甚至微调万亿参数模型。这会催生一波新的AI应用——不是大公司做的通用产品,而是小团队做的垂直场景工具。
第二,开源的壁垒消失。 Kimi K3 本身就是开源的,但kimi-k3-in-c 把开源推进到了一个更深的层次:不只是代码开源,连运行门槛也被拆除了。你不需要GPU集群,不需要云服务,甚至不需要Python。一台能编译C代码的电脑就够了。而且它用的是Apache 2.0协议——商用完全自由。这对于那些想在本地部署AI但受制于算力的中小企业来说,是一个真正的突破口。
第三,AI 的iPhone时刻正在到来。 iPhone 之前,智能手机是商务人士的奢侈品。iPhone 之后,每个人都有一台智能手机。大模型正在经历类似的转变。从需要数据中心到需要工作站到需要消费级显卡到需要笔记本——每一步都在扩大用户群体。而kimi-k3-in-c 做的,是把最后一步也踏出去了。当你只需要176KB的代码就能启动一个万亿参数模型时,AI就真的变成了一种基础设施,就像电力和网络一样,你不需要理解它的工作原理,只需要插上就能用。
下次有人告诉你"大模型需要大量算力",你可以告诉他:有人用176KB的C代码和8GB内存,跑起了2.8万亿参数的模型。
速度慢?那只是第一版。
数据来源:kimi-k3-in-c GitHub (FareedKhan-dev/kimi-k3-in-c, 2026年8月)、sqliteai/waste GitHub (sqliteai/waste, 2026年8月)、Kimi K3 官方仓库 (MoonshotAI/Kimi-K3, 2026年7月)、Kimi K3 Tech Report