DSH GetDSH Get

视觉与多模态

Browse 视觉与多模态 plugins for DeepSeek Harness on dshget.com.

92 个插件

排序

modlens

3768

为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。

视觉与多模态liustack

dsh-vision-router

1030

为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。

视觉与多模态ysr666

dsh-vision-toolkit

842

让纯文本模型处理视觉任务:粘贴图片后自动切换到 Vision Toolkit 变体,支持图片问答、多图比较、长截图 OCR、截图还原前端 UI、元素定位与像素对比。默认无需 API Key——图片经作者自建的免费服务处理,每台机器每天 100 张;也可改为指向自己的服务商。

视觉与多模态Anionex

dsh-imagegen

40

面向 DSH Web GUI 的 AI 生图插件:通过可配置的 OpenAI 兼容端点(gpt-image-2 / gpt-image-1 / dall-e-3)实现文生图与图生图,提供 api_url/api_key 设置卡片与侧边栏分栏生图工作台。

视觉与多模态dickpy

dsh-comfyui

36

让 DeepSeek Harness 的 Agent 直接驱动本地或远程 ComfyUI:comfyui_run / comfyui_object_info / comfyui_workflow 工具生成与编辑图像、视频,附带工作流库(图工作流提取:按分量 / 主流程 / 整体)、加载区分辨率自动匹配、实时队列、SDXL 与 Wan 2.1 模板、配套 skill 与同源媒体代理。

视觉与多模态fandc520

picturereader

35

给纯文本模型的"读图"能力:图片降分辨率+降色深+结构/色彩指纹渲染成文本网格喂回对话,模型像多模态一样自主缩放、取样、OCR 读图;纯本地零外部模型依赖,附读图方法论 skill 与可选 PaddleOCR。

视觉与多模态jing-hy

dsh-media-skills

19

面向纯文本模型的免费视觉桥与生图:粘贴读图、GLM-4V-Flash 与 Gemini 引擎故障转移、modlens 同款结构化证据输出,并自动播种免费视觉模型路由。

视觉与多模态MJorgin

dsh-vision-proxy

15

DeepSeek 大脑 + 自动识图:GUI 附加的每张图片自动经官方 deepseek-v4-flash-vision-exp 原生识图转译,再交给纯文本的 DeepSeek 作答(纯文本 V4-Pro 也能看图);支持任意 OpenAI 兼容 VLM 与本地 Ollama 作为备选。

视觉与多模态Flyvhidbwo

dsh-vision-opencode

13

给纯文本主模型加可配置识图模型:vision_read_image 工具、输入框识图模型选择器,以及纯文本路由的图片自动转文字。

视觉与多模态poiuyjie

dsh-visual-plugin

12

给纯文本模型装上眼睛:把用户图片转发给任意 OpenAI 兼容的视觉模型生成描述,并在 Web UI 右侧面板展示结果。

视觉与多模态jyh20030112

dsh-chat-imagine

11

在 DSH 聊天窗口自动调用生图工具(API 渠道,或本机 CLI:已支持 mmx / codex / agy)并展示图片,也支持利用对应 CLI 识别图片。

视觉与多模态corrinehu

dsh-vision

11

外挂识图插件:鲸鱼按钮配置面板、图片识图自动回传、模型自主截图识图工具。

视觉与多模态linenxi-ctrl

Gemini-Eyes

11

接入 gemini.google.com 的 MCP 桥:图片/视频视觉识别、Imagen 生图、Veo 生视频与历史对话管理,复用浏览器登录态,无需 API Key。

视觉与多模态ConsoleSun

dsh-web-ui#dsh-tool-describe-image

10

describe_image 模型工具:让纯文本模型通过视觉语言模型获得图像理解能力。

视觉与多模态DamonKoy

dsh-deepseek-vision

8

视觉语言网关:注册支持图片输入的 DeepSeek provider 路由,图片先由可配置 VL 模型(默认 Qwen-VL)描述成文字再发送。

视觉与多模态siegfly

dsh-free-vision

8

免费视觉插件:纯文本模型看图 / OCR / UI / 报错分析,优先免费模型(千问 Qwen3-VL-Flash、豆包、DeepSeek-OCR),设置界面可配置。

视觉与多模态FuzzySoul

dsh-vision

8

纯文本 DeepSeek 的识图插件:默认走豆包 Web(零成本、免 API key,经 Windows CDP 桥接驱动已登录 Chrome),另有反重力额度(flash/pro)与 Gemini 降级通道;档位自动升级、视觉证据记忆与会话压缩恢复、内容哈希缓存、双语客户端面板。

视觉与多模态54xkeee

dsh-highres-vision

7

为 DeepSeek Harness 原生视觉模型 deepseek-v4-flash-vision-exp 提供高清识图:将图片准入上限提升至 32 MiB / 8192 px / 600 张,并新增 highres_read 工具,将大图切为整图与 800x800 分块后经宿主 read_image 注入模型。

视觉与多模态azwosile

dsh-windows-ocr

7

本地 Windows 引擎(Windows.Media.Ocr)识别附加图片:只把识别出的文字发送给模型,图片字节不进入上下文;视觉直通可选开启。

视觉与多模态maxwell-feng

dsh-plugin-appshot

6

DSH 版 Codex Appshots:全局快捷键精准捕获当前工作窗口,零摩擦挂载至 Composer 作为上下文向 Agent 提问。

视觉与多模态TaurusWood

deepseek-vision#plugins/dsh-plugin-deepseek-vision

5

面向纯文本 DeepSeek 的视觉 MCP + DSH 插件:analyze_image / analyze_clipboard / compare_images / vision_status 四个工具、可视化配置页、默认免费 GLM-4.6V-Flash、结果缓存与限流容错,Key 不入日志。

视觉与多模态GOU-GEE

dsh-guide-dog

5

基于 MiniMax 的多模态插件:实时语音通话模式(流式对话、悬浮胶囊 UI)、语音模式与麦克风语音输入,并提供图像/视频/音乐/语音生成与视觉检查工具。

视觉与多模态AtropinolTT

dsh-image-pathify

5

让纯文本模型也能处理聊天贴图,提供原生视觉体验,支持批量看图,走内置 OpenAI 兼容识图工具 analyze_image;具备视觉能力的模型不受影响。

视觉与多模态dami9527

dsh-vision-bridge

5

将会话图片转交可配置视觉服务,并向符合条件的 DeepSeek Harness 模型路由返回纯文本分析。

视觉与多模态GXX182

dsh-vision-hub#tool-vision

5

增强版视觉工具箱:14 个像素级视觉工具(看图问答/定位/检测/裁剪/像素比对/OCR/长截图OCR/矢量化/取色/抠图/截图/展示/落盘/网页截图),单一 OpenAI 兼容端点驱动,桥接标记极简、规则下沉系统提示,带内容安全识别与限流自动重试。

视觉与多模态xing666173

free-vision-skill

5

基于 macOS Vision Framework 的全本地识图插件:`ocr_image`(文字提取,表格结构+坐标)与 `view_image`(场景/人脸/二维码);web 输入框可直接粘贴多张图片,图片永不离开你的 Mac。

视觉与多模态niyongsheng

dsh-llm-vision-bridge

4

DeepSeek 视觉桥接:注册原生 LLM provider,聊天内粘贴的图片自动由视觉模型(pi-ai/llama.cpp 上的 Qwen3-VL)转成文字描述后交给纯文本 DeepSeek 作答——图片准入、路由与会话压缩全部走 harness 原生机制,带 LRU 描述缓存与 503 重试。

视觉与多模态Einskyle

dsh-plugin-multimodal

4

在纯文本 DeepSeek 线路上开放贴图准入,用视觉 sidecar 把附件转成文字,原生视觉模型不改写。

视觉与多模态shinjiyu

dsh-screenshot

4

DSH 轻量截图插件:一键全屏,或先摆好窗口再框选;Agent 可自助截屏;传路径不传图、零依赖零二进制;路径通用,接上 modlens(选装)即可一步读出结构化内容。

视觉与多模态paicat1

dsh-vision-mix

4

把文本、识图和生图 API 组合成一个 Mix 模型并按对话内容自动路由:纯文本走聊天模型,用户图片和 Agent 截图走识图模型,后续可继续追问同一张图;还支持图片生成与编辑及会话级调用记录。

视觉与多模态haiziyao

dsh-vision-tools

4

DeepSeek Harness 视觉能力全家桶:vision_understand 工具(OpenAI 兼容视觉 API,默认免费智谱 GLM-4V-Flash)+ 粘贴/拖拽/按钮三入口识图。

视觉与多模态moon09300731

Deepseek-Continuity

3

本地生成图像/配音/音乐/音效并听写,同一性锁定:角色、动物、道具与配音角色定妆定声一次,之后每次调用复用同一份参考;退化产物(接近纯色的图、静音的音频)被拒绝而不是当成成功返回;生成的台词可以听写回文字,好让吞掉结尾的克隆暴露出来。空闲时引擎卸载显存,生图与听写也可改指向任意 OpenAI 形状的 API 而不用本地 Vulkan 后端。

视觉与多模态linxuhao

dsh-draw-router

3

DeepSeek Harness 统一绘图路由器:自动识别任意 OpenAI 兼容接口的绘图模型,提供 draw_image 和 draw_list_sources 工具,支持商汤、阶跃、Agnes、千问、Flux、SD、Imagen 等。

视觉与多模态xiaozhe7772222

DSH-dseyes

3

为纯文本 DeepSeek 提供原生图片上传体验:在 Web GUI 粘贴/拖入图片即以缩略图附件进入会话,发送前由 host 用免费智谱 GLM-4V-Flash 视觉 API(glm-4v-flash 降级链)读取并替换为文字描述,DeepSeek 据此回答,原图保留在聊天历史中。

视觉与多模态Okkay712

dsh-image-gen

3

GPT Image 2 `image_gen`:默认复用 Codex 订阅 OAuth,也可显式使用 API Key;显影卡片、最多 3 张 API 实时局部图、持久附件回放/灯箱/下载、纯文本模型输出和受限的凭据安全请求。

视觉与多模态LeemanCheung

dsh-image-vision

3

让任意 DSH 模型都能识图:提供 vision/OCR/定位/裁剪四件套工具,内置病理、细胞、解剖、临床与科研统计图等专业预设。

视觉与多模态xiaoyuink

查看该分类全部 (92) →