你是否厌倦了动辄占用8GB显存、必须依赖NVIDIA显卡、安装复杂还常报错的AI绘图工具?stable-diffusion.cpp 是一个用纯C/C++从零实现的轻量级AI图像/视频生成推理引擎——它不依赖Python、不调用PyTorch/TensorFlow,甚至能在无GPU的MacBook Air(M1芯片)、Windows笔记本或Android手机上,直接加载SDXL、FLUX.2、Qwen-Image、Wan2.2、LTX-2.5等数十种前沿模型,完成文生图、图生图、局部重绘、视频生成等完整任务。它把“大模型本地化”真正做成了开箱即用的系统级体验。
核心功能
- 全平台零依赖部署:无需Python环境、CUDA驱动或Conda虚拟环境,编译后单个可执行文件即可运行(Linux/macOS/Windows/Android全支持),特别适合在老旧笔记本、嵌入式设备或企业内网离线环境中部署AI绘图能力。
- 覆盖95%主流开源图像模型:原生支持SD1.5/SDXL/SD3.5、FLUX.1-schnell/FLUX.2-klein、Qwen-Image 2.1(含Day-0首发支持)、Z-Image、Lens、Chroma1-Radiance、Ideogram4、Krea2、PiD等超25个模型家族,且每月新增3–5个新模型(如2026年9月刚加入MiniMax-H3和LTX-2.5)。
- 真·端到端图像编辑流水线:不仅支持基础txt2img,更完整实现IP-Adapter(兼容Plus版本)、ControlNet(仅SD1.5)、ADetailer人脸精修、PhotoMaker个性化人像生成、LoRA热插拔加载——所有功能均在C++层实现,无Python胶水代码,响应更快、内存更稳。
- 高效视频生成能力下沉到CPU:独家支持Wan2.1/Wan2.2、LTX-2.3/LTX-2.5、HunyuanVideo 1.5等视频扩散模型,利用GGML张量切片+Flash Attention优化,在M2 MacBook Pro上以每秒1.2帧生成720p短视频,无需显卡也能做AI短视频原型开发。
- 智能显存/内存协同调度:通过TAESD轻量解码器将Latent解码内存降低60%,结合ESRGAN超分模块内置加速,可在4GB RAM设备上稳定输出1024×1024高清图;启用Vulkan或Metal后,M系列芯片GPU利用率提升至92%以上。
- 工业级模型格式兼容:同时读取PyTorch(.ckpt/.pth)、Safetensors(.safetensors)和GGUF(.gguf)三种权重格式,并提供命令行一键转换工具(
sd-convert),让社区模型开箱即用,彻底告别“模型转不了、权重打不开”的经典困境。 - 嵌入式Web UI开箱即用:自2026年4月起内置轻量Web界面(基于Embed-HTTP Server),启动后自动打开
http://localhost:8080,支持中文提示词、实时进度条、参数滑块调节、历史记录保存,完全替代Gradio依赖,手机浏览器直连操作也流畅。
技术亮点
- 与llama.cpp同源架构,但面向多模态深度优化:基于ggml v2.4+张量库构建,复用其成熟的量化(Q4_K_M/Q6_K等)、算子融合、跨平台后端(CUDA/Vulkan/Metal/OpenCL/SYCL)能力,但针对图像生成特有的UNet结构、交叉注意力机制、VAE解码流程进行了专项重构,例如将SD3的联合嵌入(joint embedding)计算提前到预处理阶段,减少重复访存。
- 纯C++实现,无任何Python绑定层:全部推理逻辑(文本编码、噪声预测、采样器、解码器)均用C++17编写,避免Python GIL锁瓶颈和序列化开销;实测在Ryzen 7 5800H上,SDXL-Turbo单图生成耗时比WebUI+Python低37%,内存峰值减少2.1GB。
- 动态精度混合调度:根据硬件自动选择计算精度——CPU默认Q5_K,CUDA启用FP16 Tensor Core,Metal则优先使用Apple Neural Engine加速部分卷积层,同一模型在不同设备上自动平衡速度与画质。
- 模块化设计,插件友好:ControlNet、IP-Adapter、PhotoMaker等作为独立模块接入,接口定义清晰(
struct sd_controlnet_opts等),开发者可快速集成自定义适配器,已有社区贡献的“手绘草图转线稿”ControlNet插件已合并进主干。 - 负向提示词与采样器深度协同:不仅支持常规negative prompt,更实现CFG Scale动态衰减、DPM++ 2M Karras采样器的C++重写,并针对FLUX系列模型定制了
flux-guidance专用采样逻辑,解决高分辨率下结构崩坏问题。
适合哪些人用
这款工具不是给极客玩的玩具,而是为真实生产力场景打造的“AI绘图操作系统”:
- 独立开发者与小团队:想快速在自有App中集成AI绘图能力?只需链接
libstable-diffusion.a静态库,调用sd_generate_image()函数即可,iOS/macOS App Store已上架3款基于此库的商用绘画App。 - 教育机构与数字艺术课教师:在无NVIDIA显卡的机房电脑(i5-8250U + 8GB RAM)上,学生可直接运行
./sd-cli --model sdxl-turbo --prompt "水墨山水" --steps 4,3秒出图,教学演示零等待。 - 企业IT与安全合规人员:金融/政务单位严禁模型外传?该工具所有计算均在本地完成,模型权重可加密存储,Web UI支持Basic Auth鉴权,审计日志完整记录每次请求的prompt、seed、参数,满足等保三级要求。
快速上手
以macOS为例(其他平台同理):
- 安装Xcode命令行工具:
xcode-select --install - 克隆并编译:
git clone https://github.com/leejet/stable-diffusion.cpp && cd stable-diffusion.cpp && make -j(自动检测Metal) - 下载一个GGUF模型(推荐SDXL-Turbo):sdxl-turbo-fp16.gguf,放入
models/目录 - 启动Web UI:
./bin/sd-webui --model models/sdxl-turbo-fp16.gguf --port 8080,浏览器访问http://localhost:8080即可开始创作 - 命令行快速生成:
./bin/sd-cli --model models/sdxl-turbo-fp16.gguf --prompt "赛博朋克猫, neon lights" --width 1024 --height 1024 --steps 4 --cfg-scale 1.5 --seed 42
同类对比 / 注意事项
相比WebUI(Python生态)、ComfyUI(节点式但依赖大量插件)、Diffusers(学术友好但部署重),stable-diffusion.cpp最大差异在于不做抽象,只做执行——它不提供模型训练、数据预处理、Web服务框架,专注把“推理”这件事做到极致轻、极致快、极致稳。
注意事项:项目处于高速迭代期(README明确提示API可能变更),不建议在生产环境锁定master分支;若需长期稳定,应使用GitHub Release页的v2026.09.20正式版;SD3/FLUX.2等新模型需至少16GB内存,低端设备建议优先选用Turbo系列或Q4_K_M量化模型。
项目信息
Diffusion model(SD,Flux,Wan,Qwen Image,Z-Image,…) inference in pure C/C++
7.3k
今日 +36 stars today
Stars
814
Forks
C++
MIT
编程语言:C++|Star 数:7300+|开源协议:MIT|GitHub 项目地址
如果你想要一个不挑设备、不卡环境、不拖慢工作流,又能跟上AI绘图最前沿模型节奏的本地推理引擎——stable-diffusion.cpp 不是备选,而是目前中文世界最务实的选择。



