
multimodal-bridge
multimodal-bridge 是一个多模态能力桥:把 Qwen 的视觉理解(Qwen-VL)与图像生成(Qwen-Image)带给没有原生多模态能力的纯文本模型(如 DeepSeek)。它有两种形态、同一套后端: MCP Server(qwen_vision / qwen_generate 工具):任何支持 MCP 的宿主(Claude Code、Kimi Code 等)直接挂载; DSH 插件(npm 包 dsh-multimodal-bridge,DeepSeek Harness bundle):dsh plugin add 一行安装,含模型自动 fallback、尺寸自适应与图片结果卡片。
这是一个带 dsh-plugin 话题的 GitHub 仓库——仓库 README 才是权威安装来源。使用下面的模板,按 README 调整包名/路径:
dsh plugin --profile web add $multimodal-bridge本地开发? 用 dsh --profile web --patch ./cordis.yml 加绝对路径插件——见插件开发。GitHub 源码? dsh plugin --profile web add github:$Spirit4471/$multimodal-bridge——需要仓库里有 prepare 脚本(见打包发布)。
| 仓库 | Spirit4471/multimodal-bridge |
| 许可证 | MIT |
| 分类 | 工具 |
| 状态 | 未验证 |
| 最近提交 | 2026-08-13 |
| 收录时间 | 2026-08-14 |
🎨 The open-source Claude Design alternative. 🖥️ Local-first desktop app. 🖼️ Your coding agent becomes the design engine: prototypes, landing pages, dashboards, slides, images & video — real files, HTML/PDF/PPTX/MP4 export. 🤖 Claude Code / Codex / Cursor / Gemini / OpenCode / Qwen & 20+ CLIs via BYOK.
查看The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics).
查看为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
查看问题或建议?官方 Discussions 是项目规范的支持渠道;Discord 里能找到活跃的社区成员。dsh.so 本身欢迎通过提交插件或反馈改进。