dsh-vision-router:让纯文本模型也能“看图”
一句话结论
给 DSH 挂上一个视觉能力路由层,用文本模型也能描述图片内容,适合做截图理解、图转提示词这类任务。
安装包:
@goodandready/dsh-vision-router 踩坑提示
- 需要配置视觉模型通道,否则只有引导流程没有结果
- 识别结果依赖所选视觉模型,对复杂图表与密集中文小字仍会出错
它解决什么问题
当你用的聊天模型是纯文本模型(比如各类推理/高速模型),会话里上传的图片它“看不见”。 这个插件提供一个视觉路由:把图片交给可用的视觉模型处理,再把描述/结论回注到会话。
典型用法
- 截图理解:把报错截图丢进来,让它描述关键信息
- 图转提示词的前置步骤:先得到客观描述,再由文本模型整理成可复用提示词模板
实测表现
- 对截图类图片(终端、网页、报错弹窗)描述准确度不错
- 对艺术风格图能给出风格标签与配色,但不要指望它做事实判断(例如识别真人身份)
- 它会走独立的一次模型调用,所以一次会话里等于多花一个模型的账
踩坑提示
- 没配视觉通道时,插件只会走一遍引导流程,不会真的返回识别结果
- 图片里的小字(尤其是中文)容易读错,关键信息建议人工复核
- 涉及他人隐私的图片不要上传,尤其不要用于公开站点的自动处理链路