Deltafin 是一个极具突破性的开源项目,它让原本需要超算集群才能运行的国产顶尖大模型——月之暗面(Moonshot)发布的 Kimi K3(参数量高达 2.8 万亿!)——首次在单台消费级设备上真正落地。它不是简化版、不是蒸馏模型,而是完整保留全部 16 个专家路由路径与原始模型结构,在 Apple M 系列芯片或主流 Linux 工作站上实现端到端推理。它解决了本地 AI 开发者最痛的难题:想用最强中文模型,却买不起千卡集群,也找不到轻量替代方案。
核心功能
- 真·全量 Kimi K3 本地运行:不裁剪专家、不降低精度,完整加载并执行 Moonshot 官方发布的 Kimi-K3 模型(Hugging Face 可获取),所有 token 均由原模型最终验证生成
- 跨平台智能硬件调度:自动识别 macOS(Apple Silicon)、x86-64 或 ARM64 Linux 环境,优先启用 MPS(Metal Performance Shaders)、CUDA 或纯 CPU 后端,并为专家层动态选择 MXFP4 量化内核以提升吞吐
- OpenAI 兼容 API 服务:一键启动标准 /v1/chat/completions 接口,无缝接入 LangChain、LlamaIndex、Cursor、Continue 等主流 Agent 框架和 IDE 插件,本地也能当“私有 OpenAI”用
- 实测高效推理性能:在 64GB 内存的 M1 Max 笔记本上实测达 0.266 token/s(约 3.76 秒/词),且随硬件升级(如 M3 Ultra、RTX 4090 工作站)可线性提升,非理论极限
- 零妥协的质量保障机制:采用“草案-验证”双阶段架构,小模型仅用于推测加速,但每个输出 token 必须经完整 Kimi K3 模型重新校验,杜绝幻觉放大与质量降级
- 开箱即用的轻量部署体验:无需手动编译 CUDA 扩展、不依赖 Docker,Python 3.10+ 环境下 pip install 即可启动,附带详细日志与性能监控提示
适合哪些人用
如果你是以下身份之一,Deltafin 正为你而生:
• 中文大模型研究者:想在本地复现 Kimi K3 行为、调试 MoE 路由逻辑、对比不同量化策略效果;
• 企业私有 Agent 开发者:需绕过公网 API 限制,将高安全、强中文能力的 K3 集成进内部代码助手、客服机器人或知识库系统;
• 硬核技术爱好者:手头有 M 系列 Mac 或高性能 Linux 主机,不愿只用 7B/14B 小模型“将就”,追求真正旗舰级本地体验;
• 教育/科研团队:预算有限但需教学演示真实万亿级 MoE 架构,Deltafin 提供了迄今最易部署的参考实现。
快速上手
只需三步即可运行:
- 确保环境:macOS 13+(Apple Silicon)或 Ubuntu/Debian 22.04+(x86_64/aarch64),Python 3.10–3.12,显存 ≥24GB(Linux CUDA)或统一内存 ≥64GB(Mac)
- 安装依赖:
pip install deltafin(自动处理 torch、transformers、accelerate 等兼容版本) - 启动服务:
deltafin serve --model moonshotai/Kimi-K3 --port 8000,然后访问http://localhost:8000/v1/chat/completions即可调用,支持 curl、Postman 或任何 OpenAI SDK
首次运行会自动下载模型权重(约 220GB),建议挂载高速 SSD 并预留充足磁盘空间。详细配置(如量化精度、批处理大小、专家卸载策略)见项目文档 OPTIMIZATIONS.md。
项目信息
Run full Kimi K3 on a single device. And an OpenAI-compatible API server for local chat and coding agents.
558
Stars
64
Forks
Python
NOASSERTION
编程语言:Python|Star 数:558|开源协议:NOASSERTION(作者明确允许非商业及研究用途自由使用)|GitHub 项目地址
如果你相信“最强中文模型不该被云厂商垄断”,Deltafin 就是你此刻最值得尝试的本地化钥匙——它不妥协性能,不牺牲质量,更不设准入门槛。


