你是否厌倦了每次调用 AI 时都要联网、等响应、担心数据泄露,甚至为 token 精打细算?Magnitude 不是一个新模型,也不是另一个聊天界面——它是一个轻量、智能、完全离线的开源推理服务器,专为「AI 代理(Agent)」而生。它能自动识别你的 CPU/GPU、内存和带宽,精准推荐并一键部署最适合你硬件的本地大模型(如 Phi-3、Qwen2、Llama-3-GGUF 等),然后无缝接入你正在用的 Pi、Hermes、Cline 或 OpenCode 等 Agent 工具。一句话:它把“让本地模型真正好用”的复杂工程,压缩成一句提示词。
核心功能
- 硬件感知型模型推荐:不再靠经验猜“我的 Mac M2 能跑多大的模型”。Magnitude 启动时自动运行
profile流程,精确测量芯片型号、可用内存、PCIe 带宽与缓存延迟,结合模型量化等级(Q4_K_M/Q5_K_S)、KV 缓存开销与 speculative decoding 兼容性,给出带实测 tok/s 预估的模型清单——比如明确告诉你“Qwen2-1.5B-Q5_K_S 在你 16GB 内存的 Linux 笔记本上预计 42 tok/s,可稳定运行”。 - Agent 一键接管式配置:无需手动改 config、写路由、配端口。只需向你的 Agent(如 Cline 或 Oh My Pi)发送一句:“
Set up local models for me with the Magnitude CLI”,Agent 就会调用 CLI 自动完成安装、交互式选模、生成 harness 配置、重启服务全流程,并将后续所有 LLM 调用自动路由至本地 Magnitude 实例。 - 按需加载 + 智能卸载:解决本地模型常驻内存导致卡顿的痛点。Magnitude 不预加载所有模型,而是“用时加载、闲时释放”——当 Agent 发起请求时才加载对应 GGUF 模型到显存/内存;若连续 90 秒无请求,或系统剩余内存低于阈值(默认 1.2GB),自动卸载模型,彻底释放资源,笔记本多开 IDE + Browser + Agent 也不卡。
- 端到端推理优化内置:不是简单封装 llama.cpp。它默认启用 speculative decoding(草案解码)、动态批处理(dynamic batching)、CUDA Graphs(NVIDIA GPU)及 Metal Acceleration(macOS),且所有参数均根据 profile 结果自动调优——例如在 M3 MacBook 上自动启用 Metal 加速并限制最大 context 为 4K,避免显存溢出;在树莓派 5 上则强制使用 CPU 推理+Q4_K_S 量化,确保稳定。
- 全链路离线与隐私保障:从模型下载(首次需网络)、到推理执行、再到 prompt 处理与文件解析(如 Agent 上传的 PDF/代码),全程不上传任何数据。模型权重、tokenizer、prompt history、临时文件全部保留在本地目录(默认
~/.magnitude/models),连日志都不外发,满足企业内网、金融合规、科研敏感数据等强隐私场景。 - 跨 Agent 生态即插即用:官方原生支持 Pi、OpenCode、Hermes、OpenClaw、Codex、Claude Code、Oh My Pi、Cline 八大主流 Agent 框架。无论你用的是基于 LangChain 的自研工具,还是开箱即用的 Cline,只需运行
magnitude setup,CLI 即可自动检测已安装的 Agent 并注入适配器,无需修改一行 Agent 源码。 - 模型目录开放可扩展:内置模型目录(含 70+ 经测试的 GGUF 模型)只是起点。你可以直接从 Hugging Face 下载任意兼容 llama.cpp 的 GGUF 模型(如 TinyLlama、Starling-LM),用
magnitude model add /path/to/model.Q5_K_M.gguf注册进系统,Magnitude 会自动分析其架构、量化方式与内存需求,并纳入推荐列表与负载调度体系。
技术亮点
- 纯 TypeScript 构建的服务端架构:不同于多数本地推理工具采用 Python(依赖环境复杂)或 Rust(编译门槛高),Magnitude 用 TypeScript 编写核心服务层,通过 Node.js 运行时提供跨平台一致性;底层推理引擎则复用经过工业验证的 llama.cpp(C/C++),通过 WASI 或子进程桥接,兼顾开发效率与执行性能。
- 硬件画像驱动的模型决策引擎:其
profile模块不仅读取/proc/cpuinfo或system_profiler,更会实际运行 micro-benchmarks:如用 tinyllama 推理 100 tokens 测算真实吞吐、用 mmap 分配大内存块测试 OOM 行为、模拟不同 quant 级别下的 KV cache 占用——这些数据构成模型推荐的唯一依据,而非静态规则表。 - Agent-Centric 的协议抽象层:不强制要求 Agent 改用 OpenAI API 兼容格式。Magnitude 提供
harness模式(内置轻量 Agent)与proxy模式(适配已有 Agent)。后者通过解析各 Agent 的 SDK 调用栈,动态注入模型路由逻辑,例如对 Pi 的pi.chat()调用自动转为本地 HTTP POST,对 Cline 的cl.run()则注入 stream handler,实现“零侵入集成”。 - Apache 2.0 协议下的全栈可控:从 CLI 工具链(
@magnitudedev/cli)、服务端(@magnitudedev/server)到模型注册中心(@magnitudedev/catalog),全部开源且无闭源组件。你可以 fork 后修改模型加载策略、替换 llama.cpp 版本、甚至对接自研的 WebGPU 推理后端——这是 Ollama 或 LM Studio 等封闭方案无法提供的自由度。
适合哪些人用
它不是给“只想试试本地模型”的新手准备的玩具,而是为三类真实用户打造的生产力基础设施:
- Agent 开发者:正在构建自己的编程助手、自动化客服或研究工作流,但被模型部署、硬件适配、资源调度拖慢迭代速度。案例:某团队用 Hermes 搭建内部代码审查 Agent,过去需为不同工程师的 Mac/Windows/云服务器分别维护三套 Ollama 配置;接入 Magnitude 后,统一用
magnitude setup一键生成适配脚本,CI 流水线自动按机器 profile 选择模型,上线周期缩短 70%。 - 隐私敏感型终端用户:律师、医生、金融从业者或开源贡献者,日常需让 AI 处理合同、病历、财报或私有代码库,绝不能容忍数据出域。案例:一位开源律师用 Cline + Magnitude 在离线笔记本上分析 GPL 协议文本,所有 prompt、PDF 解析结果、生成建议均不联网,且模型仅在需要时加载,关机即清空内存。
- 边缘计算实践者:在树莓派、Jetson Orin 或旧笔记本上部署轻量 AI 应用。Magnitude 对 ARM64/Linux 的深度支持(包括 Raspberry Pi OS 的 kernel module 优化)使其成为边缘 Agent 的理想推理底座。案例:某物联网团队在 8GB RAM 的树莓派 5 上运行 OpenClaw 控制智能家居,Magnitude 自动选用 Phi-3-mini-Q4_K_M 模型,响应延迟稳定在 1.2 秒内,功耗低于 8W。
快速上手
只需两步,5 分钟内完成:
- 全局安装 CLI:
npm install -g @magnitudedev/cli(推荐用 pnpm 或 bun 加速) - 启动向导:
magnitude docs onboarding—— 此命令会打开本地文档页,并引导你完成:
① 运行硬件 profile
② 浏览推荐模型列表(含 tok/s、内存占用、支持 context 长度)
③ 选择模型并下载(自动选择最优量化版)
④ 检测已安装的 Agent 并注入配置
⑤ 启动 Magnitude 服务(后台常驻)
完成后,你的 Agent 就已切换至本地模型。想手动管理?magnitude status 查状态,magnitude model list 看已装模型,magnitude model switch qwen2-1.5b 秒切模型。
同类对比 / 注意事项
- vs Ollama:Ollama 是通用模型运行时,需手动
ollama run启动模型,且无硬件感知推荐、无 Agent 深度集成、无内存智能回收。Magnitude 专注“Agent 场景”,把 Ollama 的run变成auto-load-on-demand,并内置完整 Agent 生态适配。 - vs LM Studio:LM Studio 是 GUI 工具,适合单点调试,但缺乏 CLI 自动化、无 profile 推荐、不支持 WSL(Magnitude 明确支持 WSL2),且无法嵌入 CI/CD 或 Agent 工作流。
- 注意事项:目前暂不支持 Windows 原生(需 WSL2);首次下载大模型(如 Qwen2-7B)可能需较长时间;若 Agent 使用非标准端口或自定义 SSL,需在
magnitude setup后手动微调~/.magnitude/config.json中的upstream字段。
项目信息
Open source inference server that runs the best local models for your hardware, plugged into the agent you already use. Works with Pi, OpenCode, Herme
2.0k
今日 +161 stars today
Stars
145
Forks
TypeScript
Apache-2.0
TypeScript|2046 ⭐|Apache-2.0 开源协议|GitHub 项目地址
如果你受够了为云端 API 付费、为数据安全提心吊胆、为模型兼容性反复折腾——Magnitude 就是那个让你把 AI 真正“握在手里”的开源答案。



