DSH 插件

dsh-vision-router:让纯文本模型也能“看图”

更新于 2026-09-29 约 1 分钟 见 npm 包页 入门
一句话结论
给 DSH 挂上一个视觉能力路由层,用文本模型也能描述图片内容,适合做截图理解、图转提示词这类任务。
踩坑提示
  • 需要配置视觉模型通道,否则只有引导流程没有结果
  • 识别结果依赖所选视觉模型,对复杂图表与密集中文小字仍会出错

它解决什么问题

当你用的聊天模型是纯文本模型(比如各类推理/高速模型),会话里上传的图片它“看不见”。 这个插件提供一个视觉路由:把图片交给可用的视觉模型处理,再把描述/结论回注到会话。

典型用法

  • 截图理解:把报错截图丢进来,让它描述关键信息
  • 图转提示词的前置步骤:先得到客观描述,再由文本模型整理成可复用提示词模板

实测表现

  • 对截图类图片(终端、网页、报错弹窗)描述准确度不错
  • 对艺术风格图能给出风格标签与配色,但不要指望它做事实判断(例如识别真人身份)
  • 它会走独立的一次模型调用,所以一次会话里等于多花一个模型的账

踩坑提示

  1. 没配视觉通道时,插件只会走一遍引导流程,不会真的返回识别结果
  2. 图片里的小字(尤其是中文)容易读错,关键信息建议人工复核
  3. 涉及他人隐私的图片不要上传,尤其不要用于公开站点的自动处理链路