给纯文本大模型装上“眼睛”:ModLens——零配置图像理解插件,粘贴即得结构化视觉证据

2026-08-25 0 44

你是否遇到过这样的尴尬:手边正开着 DeepSeek-V4-Pro 或 GLM-4 的聊天窗口,想让 AI 帮你看一张发票、分析一页 PDF 扫描件、识别手机截图里的代码错误,却发现——它根本“看不见”?因为这些顶尖开源模型本质是纯文本(text-only)架构,不支持原生图像输入。ModLens 正是为此而生:它不是另一个多模态大模型,而是一个轻量、即插即用的「视觉外挂引擎」,无需修改任何模型或框架,只需在聊天框中 Ctrl+V 一张图,几秒后就能返回带 OCR 文本、阅读顺序版面框、语义实体与关系的结构化 JSON——真正实现“所见即所得”的智能增强。

核心功能

给纯文本大模型装上“眼睛”:ModLens——零配置图像理解插件,粘贴即得结构化视觉证据

  • 一键粘贴,自动解析图像内容:解决用户必须先保存图片到本地、再手动上传路径的繁琐流程。ModLens 拦截剪贴板中的图像数据,直接转为临时文件并触发分析,全程无感知,和日常聊天一样自然。
  • 输出结构化视觉证据而非自由描述:不同于普通多模态模型“说说这张图”,ModLens 返回的是可编程、可校验的 JSON,包含精确 OCR 结果(含置信度)、按阅读流排序的文本块坐标(layout regions)、提取出的姓名/金额/日期等实体列表,以及“发票号→对应金额”这类语义关系对,便于后续自动化处理。
  • 深度适配 DeepSeek Harness(DSH)生态,开箱即用:通过官方插件机制集成,执行 npx -y @deepseek-ai/dsh plugin --profile web add @liustack/modlens@3.24.2 一行命令即可启用,无需改配置、不启代理、不碰源码,卸载也只需删一个文件夹。
  • 智能模型路由,绝不干扰原生视觉能力:自动识别当前 harness 中所有模型元数据,仅对明确标注为 text-only 的模型(如 DeepSeek-V4-Flash、GLM-4-All)注入视觉能力;而原生支持图像的模型(如 Qwen-VL、DeepSeek-VL)则完全绕过 ModLens,保持原有行为,避免误覆盖。
  • 多平台无缝兼容,不止于 DSH:已在 Claude Code、Codex、Pi Agent、OpenCode 等主流技能型 AI 框架中实测通过,同一套插件逻辑复用,开发者无需为不同平台重复开发视觉模块。
  • 零本地依赖,API 键智能轮转:默认使用免费 Gemini API(5–10 秒响应),也支持 OpenAI 兼容接口(如 Ollama、AnythingLLM)。当某密钥触发限频、欠费或认证失败时,自动切换至下一可用密钥,保障服务连续性,无需人工干预。
  • 双模式粘贴体验,兼顾效率与可读性:① 默认模式:图片以路径形式进入消息流,后台静默处理;② 视觉模式:在模型选择器中切换至 (modlens vision) 条目后,粘贴图片会以缩略图形式保留在对话中,更贴近 Codex 等成熟应用的交互直觉。
  • 配套生态完善,延伸生产力链路:作者同步维护 ModSearch(免费 Web 搜索插件)与 AIManager(零配置桌面启动器),形成从安装、搜索到视觉理解的一站式 DeepSeek 工具链。

技术亮点

给纯文本大模型装上“眼睛”:ModLens——零配置图像理解插件,粘贴即得结构化视觉证据

  • 极简架构设计,拒绝过度工程:不引入本地代理服务、不 Hook 浏览器 API、不修改任何 harness 核心配置。在 DSH 中仅为一个标准插件包,在技能型框架中仅为一个 skill 文件夹,真正做到“加减法清晰、边界干净”。
  • 基于 TypeScript 构建,类型安全贯穿全流程:从图像二进制解析、OCR 请求封装、布局分析到 JSON Schema 校验,全程强类型约束,大幅降低因字段缺失或格式错乱导致的下游解析失败风险,特别适合集成进自动化流水线。
  • 证据驱动(Evidence-First)设计理念:所有输出均锚定原始像素信息——OCR 文本必带 bounding box 坐标,语义关系必引用原文片段,杜绝幻觉式概括。例如识别表格时,不仅返回“总计:¥12,800”,还会附上该数字在图像中的精确位置及上下文行。
  • 动态 Provider 发现与 Failover 机制:运行时自动探测系统已配置的各类 LLM 接口(包括本地 Ollama、远程 OpenAI 兼容端点),构建可用 provider 列表;请求失败时按预设策略降级,支持 comma-separated 多密钥轮询,显著提升企业级部署鲁棒性。
  • 与 harness 引擎深度协同,非简单 wrapper:利用 DSH 的 tool calling 机制注册 modlens_read_image 工具,由模型自主决定何时调用、如何组合参数,使视觉能力真正成为 agent 的“技能”而非“外部黑盒”,为复杂多步任务(如“先 OCR 发票→再查税率→最后生成报销摘要”)提供底层支撑。

适合哪些人用

给纯文本大模型装上“眼睛”:ModLens——零配置图像理解插件,粘贴即得结构化视觉证据

ModLens 主要面向三类中文技术用户:

  • DeepSeek/GLM 生态的重度使用者:比如每天用 DSH 调试代码、写文档、处理工作流的技术人员,希望在不更换主模型的前提下,瞬间获得图像理解能力;
  • 低代码/自动化工具搭建者:需要将 OCR、版面分析结果快速接入 Notion、飞书多维表格或自研系统,ModLens 输出的标准化 JSON 可直接被 Zapier、n8n 或 Python 脚本消费;
  • 教育与科研场景实践者:高校教师用它批量解析学生提交的手写作业扫描件,提取关键公式与答案区域;研究生用它处理古籍影印本,生成带坐标的文本层用于后续 NLP 分析。

真实场景示例:一位前端工程师收到设计师发来的 Figma 截图,想快速提取按钮文案与尺寸。他打开 AIManager 启动 DSH,切换至 DeepSeek-V4-Pro (modlens vision),Ctrl+V 截图——3 秒后得到 JSON,其中 regions 数组按阅读顺序列出每个 UI 元素的坐标与文本,entities 提取了所有“按钮”、“输入框”等组件类型,他复制 JSON 到 VS Code,用简单脚本生成 React 组件骨架,效率提升 5 倍。

快速上手

给纯文本大模型装上“眼睛”:ModLens——零配置图像理解插件,粘贴即得结构化视觉证据

对于 DeepSeek Harness 用户,只需两步:

  1. 终端执行:npx -y @deepseek-ai/dsh plugin --profile web add @liustack/modlens@3.24.2
  2. 重启 DSH,进入聊天界面,点击右上角模型选择器 → 选择带 (modlens vision) 后缀的选项 → 直接粘贴图片即可

若未安装 DSH,推荐使用作者提供的 AIManager 桌面版:下载 macOS/Windows 安装包,一键启动即自动配置好 ModLens 与所有依赖,无需命令行。

其他框架(如 Codex、Pi)用户:向你的 AI 助手发送指令 “Install and configure the modlens”,它会引导完成剩余步骤。

同类对比 / 注意事项

给纯文本大模型装上“眼睛”:ModLens——零配置图像理解插件,粘贴即得结构化视觉证据

  • vs 本地多模态模型(如 Qwen-VL、InternVL):ModLens 不替代模型本身,而是赋能现有文本模型。它更轻量(无需 GPU 显存)、更快速(云端推理优化)、更易集成(无需模型转换与部署),但无法做图像生成等原生视觉任务。
  • vs 通用 OCR 工具(如 PaddleOCR、Tesseract):ModLens 不止于文字识别,还融合语义理解与结构化解析,且与 AI 工作流天然打通——OCR 结果直接成为 LLM 的上下文,无需手动粘贴中转。
  • 注意事项:首次使用需确保网络可访问 Gemini 或配置的 API 服务;若在企业内网环境,建议提前配置私有 OpenAI 兼容接口;部分老旧浏览器可能限制剪贴板图像读取,推荐使用 Chrome 或 Edge 最新版。

项目信息


📦
liustack/modlens
GitHub

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OC


3.6k
今日 +809 stars this week
Stars

🔀
105
Forks


TypeScript

📄
MIT

TypeScript | 3644 ⭐ | MIT 开源协议 | GitHub 项目地址

如果你正在用 DeepSeek 或 GLM 做真实工作,却总被“看不见图片”卡住——ModLens 就是你等待已久的那副数字眼镜:不改变习惯,不增加负担,粘贴即懂,结构即用。

收藏 (0) 打赏

感谢您的支持,我会继续努力的!

打开微信扫一扫,即可进行扫码打赏哦,分享从这里开始,精彩与您同在
点赞 (0)

本网站所提供的所有资源(包括但不限于软件、文档、教程、代码、素材等)均收集自互联网公开渠道,仅供个人学习、研究及交流使用。我们无法对所有资源的版权归属进行逐一核实。

OPENKLC昆仑草-免费资源下载-源码下载 开源易选 给纯文本大模型装上“眼睛”:ModLens——零配置图像理解插件,粘贴即得结构化视觉证据 https://www.openklc.com/2312.html

常见问题

相关文章

发表评论
暂无评论