你是否想过,一个拥有2.78万亿参数、体积近1TB的超大规模AI模型(Kimi K3),能在一台仅64GB内存的MacBook Pro上直接运行?WASTE正是为此而生——它不是模型压缩、也不是量化蒸馏,而是一种全新的推理范式:把“沉睡”的模型权重像视频流一样从高速NVMe固态硬盘实时加载进内存,只保留当前计算所需的极小部分。它彻底绕开了“内存必须装下整个模型”的传统限制,让消费级硬件首次真正触达万亿级开源大模型的原始能力。
核心功能
- 磁盘原位流式加载:不加载全量权重到内存,而是按需从NVMe SSD动态读取激活的专家层(Experts),延迟可控、带宽利用率高
- 零第三方依赖:纯C语言实现,无Python、无CUDA Runtime、无OpenBLAS等外部库,编译即用,可嵌入边缘设备或现有C/C++系统
- 智能专家缓存管理:自动维护一个有界内存缓存池(默认约17.5GB),基于访问热度动态置换专家权重,命中率可达38%以上,显著降低IO开销
- 完整模型保真运行:支持原始Kimi K3 2.78T全参数版本(非剪枝/非蒸馏/非量化),输出质量与官方一致,不牺牲任何能力
- 极简命令行交互:一条命令即可启动推理,支持标准文本输入输出,天然适配脚本、管道和自动化工作流
- 跨平台轻量部署:已验证在macOS(Apple Silicon)、Linux x86_64及ARM64环境稳定运行,静态链接后二进制文件仅数MB
适合哪些人用
如果你是以下角色之一,WASTE值得立刻关注:
• 本地AI实践者:手头只有高端笔记本(如M3 MacBook Pro、RTX 4090台式机),却想实测最新开源大模型的真实表现;
• 嵌入式/AIoT开发者:需要将大模型能力集成进资源受限但配备NVMe的工业终端或边缘网关;
• 系统工程师与编译器爱好者:对极致精简、无GC、无运行时依赖的底层推理引擎设计感兴趣;
• 教育与研究者:希望向学生演示“内存瓶颈如何被架构创新突破”,或开展MoE模型加载机制相关课题。
快速上手
无需安装复杂环境!以macOS为例(Linux类似):
- 从GitHub Releases下载预编译二进制:
waste-darwin-arm64(Apple Silicon)或waste-linux-x86_64 - 将Kimi K3转换后的
k3.waste模型文件(982 GiB,需提前准备)放入本地路径,例如~/models/k3.waste - 终端执行:
./waste-darwin-arm64 run ~/models/k3.waste '巴黎是哪个国家的首都?' - 首次运行会自动预热缓存,后续提问响应更快;可通过
--budget 32G手动限制内存用量
注:模型转换需使用项目提供的waste-convert工具(详见README),原始Kimi K3权重需已获得授权并完成格式转换。
项目信息
sqliteai/waste
GitHub
Run the full 2.78-trillion-parameter Kimi K3 model beyond available RAM by streaming activated weights directly from NVMe. A dependency-free, embeddab
647
Stars
53
Forks
C
Apache-2.0
编程语言:C|Star 数:647|开源协议:Apache-2.0|GitHub 项目地址
这不是又一个“玩具级”轻量模型,而是一次对AI基础设施边界的硬核挑战——当万亿参数不再只是云厂商的专利,真正的本地智能时代才刚刚拉开序幕。


