视觉与多模态
Browse 视觉与多模态 plugins for DeepSeek Harness on dshget.com.
92 个插件
modlens
★ 3768为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。
dsh-vision-router
★ 1030为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。
dsh-vision-toolkit
★ 842让纯文本模型处理视觉任务:粘贴图片后自动切换到 Vision Toolkit 变体,支持图片问答、多图比较、长截图 OCR、截图还原前端 UI、元素定位与像素对比。默认无需 API Key——图片经作者自建的免费服务处理,每台机器每天 100 张;也可改为指向自己的服务商。
dsh-imagegen
★ 40面向 DSH Web GUI 的 AI 生图插件:通过可配置的 OpenAI 兼容端点(gpt-image-2 / gpt-image-1 / dall-e-3)实现文生图与图生图,提供 api_url/api_key 设置卡片与侧边栏分栏生图工作台。
dsh-comfyui
★ 36让 DeepSeek Harness 的 Agent 直接驱动本地或远程 ComfyUI:comfyui_run / comfyui_object_info / comfyui_workflow 工具生成与编辑图像、视频,附带工作流库(图工作流提取:按分量 / 主流程 / 整体)、加载区分辨率自动匹配、实时队列、SDXL 与 Wan 2.1 模板、配套 skill 与同源媒体代理。
picturereader
★ 35给纯文本模型的"读图"能力:图片降分辨率+降色深+结构/色彩指纹渲染成文本网格喂回对话,模型像多模态一样自主缩放、取样、OCR 读图;纯本地零外部模型依赖,附读图方法论 skill 与可选 PaddleOCR。
dsh-media-skills
★ 19面向纯文本模型的免费视觉桥与生图:粘贴读图、GLM-4V-Flash 与 Gemini 引擎故障转移、modlens 同款结构化证据输出,并自动播种免费视觉模型路由。
dsh-vision-proxy
★ 15DeepSeek 大脑 + 自动识图:GUI 附加的每张图片自动经官方 deepseek-v4-flash-vision-exp 原生识图转译,再交给纯文本的 DeepSeek 作答(纯文本 V4-Pro 也能看图);支持任意 OpenAI 兼容 VLM 与本地 Ollama 作为备选。
dsh-vision-opencode
★ 13给纯文本主模型加可配置识图模型:vision_read_image 工具、输入框识图模型选择器,以及纯文本路由的图片自动转文字。
dsh-visual-plugin
★ 12给纯文本模型装上眼睛:把用户图片转发给任意 OpenAI 兼容的视觉模型生成描述,并在 Web UI 右侧面板展示结果。
dsh-chat-imagine
★ 11在 DSH 聊天窗口自动调用生图工具(API 渠道,或本机 CLI:已支持 mmx / codex / agy)并展示图片,也支持利用对应 CLI 识别图片。
dsh-vision
★ 11外挂识图插件:鲸鱼按钮配置面板、图片识图自动回传、模型自主截图识图工具。
Gemini-Eyes
★ 11接入 gemini.google.com 的 MCP 桥:图片/视频视觉识别、Imagen 生图、Veo 生视频与历史对话管理,复用浏览器登录态,无需 API Key。
dsh-web-ui#dsh-tool-describe-image
★ 10describe_image 模型工具:让纯文本模型通过视觉语言模型获得图像理解能力。
dsh-deepseek-vision
★ 8视觉语言网关:注册支持图片输入的 DeepSeek provider 路由,图片先由可配置 VL 模型(默认 Qwen-VL)描述成文字再发送。
dsh-free-vision
★ 8免费视觉插件:纯文本模型看图 / OCR / UI / 报错分析,优先免费模型(千问 Qwen3-VL-Flash、豆包、DeepSeek-OCR),设置界面可配置。
dsh-vision
★ 8纯文本 DeepSeek 的识图插件:默认走豆包 Web(零成本、免 API key,经 Windows CDP 桥接驱动已登录 Chrome),另有反重力额度(flash/pro)与 Gemini 降级通道;档位自动升级、视觉证据记忆与会话压缩恢复、内容哈希缓存、双语客户端面板。
dsh-highres-vision
★ 7为 DeepSeek Harness 原生视觉模型 deepseek-v4-flash-vision-exp 提供高清识图:将图片准入上限提升至 32 MiB / 8192 px / 600 张,并新增 highres_read 工具,将大图切为整图与 800x800 分块后经宿主 read_image 注入模型。
dsh-windows-ocr
★ 7本地 Windows 引擎(Windows.Media.Ocr)识别附加图片:只把识别出的文字发送给模型,图片字节不进入上下文;视觉直通可选开启。
dsh-plugin-appshot
★ 6DSH 版 Codex Appshots:全局快捷键精准捕获当前工作窗口,零摩擦挂载至 Composer 作为上下文向 Agent 提问。
deepseek-vision#plugins/dsh-plugin-deepseek-vision
★ 5面向纯文本 DeepSeek 的视觉 MCP + DSH 插件:analyze_image / analyze_clipboard / compare_images / vision_status 四个工具、可视化配置页、默认免费 GLM-4.6V-Flash、结果缓存与限流容错,Key 不入日志。
dsh-guide-dog
★ 5基于 MiniMax 的多模态插件:实时语音通话模式(流式对话、悬浮胶囊 UI)、语音模式与麦克风语音输入,并提供图像/视频/音乐/语音生成与视觉检查工具。
dsh-image-pathify
★ 5让纯文本模型也能处理聊天贴图,提供原生视觉体验,支持批量看图,走内置 OpenAI 兼容识图工具 analyze_image;具备视觉能力的模型不受影响。
dsh-vision-bridge
★ 5将会话图片转交可配置视觉服务,并向符合条件的 DeepSeek Harness 模型路由返回纯文本分析。
dsh-vision-hub#tool-vision
★ 5增强版视觉工具箱:14 个像素级视觉工具(看图问答/定位/检测/裁剪/像素比对/OCR/长截图OCR/矢量化/取色/抠图/截图/展示/落盘/网页截图),单一 OpenAI 兼容端点驱动,桥接标记极简、规则下沉系统提示,带内容安全识别与限流自动重试。
free-vision-skill
★ 5基于 macOS Vision Framework 的全本地识图插件:`ocr_image`(文字提取,表格结构+坐标)与 `view_image`(场景/人脸/二维码);web 输入框可直接粘贴多张图片,图片永不离开你的 Mac。
dsh-llm-vision-bridge
★ 4DeepSeek 视觉桥接:注册原生 LLM provider,聊天内粘贴的图片自动由视觉模型(pi-ai/llama.cpp 上的 Qwen3-VL)转成文字描述后交给纯文本 DeepSeek 作答——图片准入、路由与会话压缩全部走 harness 原生机制,带 LRU 描述缓存与 503 重试。
dsh-plugin-multimodal
★ 4在纯文本 DeepSeek 线路上开放贴图准入,用视觉 sidecar 把附件转成文字,原生视觉模型不改写。
dsh-screenshot
★ 4DSH 轻量截图插件:一键全屏,或先摆好窗口再框选;Agent 可自助截屏;传路径不传图、零依赖零二进制;路径通用,接上 modlens(选装)即可一步读出结构化内容。
dsh-vision-mix
★ 4把文本、识图和生图 API 组合成一个 Mix 模型并按对话内容自动路由:纯文本走聊天模型,用户图片和 Agent 截图走识图模型,后续可继续追问同一张图;还支持图片生成与编辑及会话级调用记录。
dsh-vision-tools
★ 4DeepSeek Harness 视觉能力全家桶:vision_understand 工具(OpenAI 兼容视觉 API,默认免费智谱 GLM-4V-Flash)+ 粘贴/拖拽/按钮三入口识图。
Deepseek-Continuity
★ 3本地生成图像/配音/音乐/音效并听写,同一性锁定:角色、动物、道具与配音角色定妆定声一次,之后每次调用复用同一份参考;退化产物(接近纯色的图、静音的音频)被拒绝而不是当成成功返回;生成的台词可以听写回文字,好让吞掉结尾的克隆暴露出来。空闲时引擎卸载显存,生图与听写也可改指向任意 OpenAI 形状的 API 而不用本地 Vulkan 后端。
dsh-draw-router
★ 3DeepSeek Harness 统一绘图路由器:自动识别任意 OpenAI 兼容接口的绘图模型,提供 draw_image 和 draw_list_sources 工具,支持商汤、阶跃、Agnes、千问、Flux、SD、Imagen 等。
DSH-dseyes
★ 3为纯文本 DeepSeek 提供原生图片上传体验:在 Web GUI 粘贴/拖入图片即以缩略图附件进入会话,发送前由 host 用免费智谱 GLM-4V-Flash 视觉 API(glm-4v-flash 降级链)读取并替换为文字描述,DeepSeek 据此回答,原图保留在聊天历史中。
dsh-image-gen
★ 3GPT Image 2 `image_gen`:默认复用 Codex 订阅 OAuth,也可显式使用 API Key;显影卡片、最多 3 张 API 实时局部图、持久附件回放/灯箱/下载、纯文本模型输出和受限的凭据安全请求。
dsh-image-vision
★ 3让任意 DSH 模型都能识图:提供 vision/OCR/定位/裁剪四件套工具,内置病理、细胞、解剖、临床与科研统计图等专业预设。