你是否遇到过这样的尴尬:手边正开着 DeepSeek-V4-Pro 或 GLM-4 的聊天窗口,想让 AI 帮你看一张发票、分析一页 PDF 扫描件、识别手机截图里的代码错误,却发现——它根本“看不见”?因为这些顶尖开源模型本质是纯文本(text-only)架构,不支持原生图像输入。ModLens 正是为此而生:它不是另一个多模态大模型,而是一个轻量、即插即用的「视觉外挂引擎」,无需修改任何模型或框架,只需在聊天框中 Ctrl+V 一张图,几秒后就能返回带 OCR 文本、阅读顺序版面框、语义实体与关系的结构化 JSON——真正实现“所见即所得”的智能增强。
核心功能
- 一键粘贴,自动解析图像内容:解决用户必须先保存图片到本地、再手动上传路径的繁琐流程。ModLens 拦截剪贴板中的图像数据,直接转为临时文件并触发分析,全程无感知,和日常聊天一样自然。
- 输出结构化视觉证据而非自由描述:不同于普通多模态模型“说说这张图”,ModLens 返回的是可编程、可校验的 JSON,包含精确 OCR 结果(含置信度)、按阅读流排序的文本块坐标(layout regions)、提取出的姓名/金额/日期等实体列表,以及“发票号→对应金额”这类语义关系对,便于后续自动化处理。
- 深度适配 DeepSeek Harness(DSH)生态,开箱即用:通过官方插件机制集成,执行
npx -y @deepseek-ai/dsh plugin --profile web add @liustack/modlens@3.24.2一行命令即可启用,无需改配置、不启代理、不碰源码,卸载也只需删一个文件夹。 - 智能模型路由,绝不干扰原生视觉能力:自动识别当前 harness 中所有模型元数据,仅对明确标注为 text-only 的模型(如 DeepSeek-V4-Flash、GLM-4-All)注入视觉能力;而原生支持图像的模型(如 Qwen-VL、DeepSeek-VL)则完全绕过 ModLens,保持原有行为,避免误覆盖。
- 多平台无缝兼容,不止于 DSH:已在 Claude Code、Codex、Pi Agent、OpenCode 等主流技能型 AI 框架中实测通过,同一套插件逻辑复用,开发者无需为不同平台重复开发视觉模块。
- 零本地依赖,API 键智能轮转:默认使用免费 Gemini API(5–10 秒响应),也支持 OpenAI 兼容接口(如 Ollama、AnythingLLM)。当某密钥触发限频、欠费或认证失败时,自动切换至下一可用密钥,保障服务连续性,无需人工干预。
- 双模式粘贴体验,兼顾效率与可读性:① 默认模式:图片以路径形式进入消息流,后台静默处理;② 视觉模式:在模型选择器中切换至
(modlens vision)条目后,粘贴图片会以缩略图形式保留在对话中,更贴近 Codex 等成熟应用的交互直觉。 - 配套生态完善,延伸生产力链路:作者同步维护 ModSearch(免费 Web 搜索插件)与 AIManager(零配置桌面启动器),形成从安装、搜索到视觉理解的一站式 DeepSeek 工具链。
技术亮点
- 极简架构设计,拒绝过度工程:不引入本地代理服务、不 Hook 浏览器 API、不修改任何 harness 核心配置。在 DSH 中仅为一个标准插件包,在技能型框架中仅为一个 skill 文件夹,真正做到“加减法清晰、边界干净”。
- 基于 TypeScript 构建,类型安全贯穿全流程:从图像二进制解析、OCR 请求封装、布局分析到 JSON Schema 校验,全程强类型约束,大幅降低因字段缺失或格式错乱导致的下游解析失败风险,特别适合集成进自动化流水线。
- 证据驱动(Evidence-First)设计理念:所有输出均锚定原始像素信息——OCR 文本必带 bounding box 坐标,语义关系必引用原文片段,杜绝幻觉式概括。例如识别表格时,不仅返回“总计:¥12,800”,还会附上该数字在图像中的精确位置及上下文行。
- 动态 Provider 发现与 Failover 机制:运行时自动探测系统已配置的各类 LLM 接口(包括本地 Ollama、远程 OpenAI 兼容端点),构建可用 provider 列表;请求失败时按预设策略降级,支持 comma-separated 多密钥轮询,显著提升企业级部署鲁棒性。
- 与 harness 引擎深度协同,非简单 wrapper:利用 DSH 的 tool calling 机制注册
modlens_read_image工具,由模型自主决定何时调用、如何组合参数,使视觉能力真正成为 agent 的“技能”而非“外部黑盒”,为复杂多步任务(如“先 OCR 发票→再查税率→最后生成报销摘要”)提供底层支撑。
适合哪些人用
ModLens 主要面向三类中文技术用户:
- DeepSeek/GLM 生态的重度使用者:比如每天用 DSH 调试代码、写文档、处理工作流的技术人员,希望在不更换主模型的前提下,瞬间获得图像理解能力;
- 低代码/自动化工具搭建者:需要将 OCR、版面分析结果快速接入 Notion、飞书多维表格或自研系统,ModLens 输出的标准化 JSON 可直接被 Zapier、n8n 或 Python 脚本消费;
- 教育与科研场景实践者:高校教师用它批量解析学生提交的手写作业扫描件,提取关键公式与答案区域;研究生用它处理古籍影印本,生成带坐标的文本层用于后续 NLP 分析。
真实场景示例:一位前端工程师收到设计师发来的 Figma 截图,想快速提取按钮文案与尺寸。他打开 AIManager 启动 DSH,切换至 DeepSeek-V4-Pro (modlens vision),Ctrl+V 截图——3 秒后得到 JSON,其中 regions 数组按阅读顺序列出每个 UI 元素的坐标与文本,entities 提取了所有“按钮”、“输入框”等组件类型,他复制 JSON 到 VS Code,用简单脚本生成 React 组件骨架,效率提升 5 倍。
快速上手
对于 DeepSeek Harness 用户,只需两步:
- 终端执行:
npx -y @deepseek-ai/dsh plugin --profile web add @liustack/modlens@3.24.2 - 重启 DSH,进入聊天界面,点击右上角模型选择器 → 选择带
(modlens vision)后缀的选项 → 直接粘贴图片即可
若未安装 DSH,推荐使用作者提供的 AIManager 桌面版:下载 macOS/Windows 安装包,一键启动即自动配置好 ModLens 与所有依赖,无需命令行。
其他框架(如 Codex、Pi)用户:向你的 AI 助手发送指令 “Install and configure the modlens”,它会引导完成剩余步骤。
同类对比 / 注意事项
- vs 本地多模态模型(如 Qwen-VL、InternVL):ModLens 不替代模型本身,而是赋能现有文本模型。它更轻量(无需 GPU 显存)、更快速(云端推理优化)、更易集成(无需模型转换与部署),但无法做图像生成等原生视觉任务。
- vs 通用 OCR 工具(如 PaddleOCR、Tesseract):ModLens 不止于文字识别,还融合语义理解与结构化解析,且与 AI 工作流天然打通——OCR 结果直接成为 LLM 的上下文,无需手动粘贴中转。
- 注意事项:首次使用需确保网络可访问 Gemini 或配置的 API 服务;若在企业内网环境,建议提前配置私有 OpenAI 兼容接口;部分老旧浏览器可能限制剪贴板图像读取,推荐使用 Chrome 或 Edge 最新版。
项目信息
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OC
3.6k
今日 +809 stars this week
Stars
105
Forks
TypeScript
MIT
TypeScript | 3644 ⭐ | MIT 开源协议 | GitHub 项目地址
如果你正在用 DeepSeek 或 GLM 做真实工作,却总被“看不见图片”卡住——ModLens 就是你等待已久的那副数字眼镜:不改变习惯,不增加负担,粘贴即懂,结构即用。







