我平时用 ZCode 配 deepseek-v4-flash 当主力模型。速度快、便宜、写代码够用,唯一的问题是它是个纯文本模型,看不了图。

以前遇到要识图的场景就很尴尬:截图、报错信息、设计稿,发过去模型只会收到一个文件路径,内容完全看不见。要么手动把图里的文字敲进去,要么临时换个支持视觉的模型,看完再换回来,会话上下文还断了,成本也上去了。

后来逛 GitHub 看到 zcode-deepseek-eye,思路正好对胃口:主模型不换,在 ZCode 里挂一个支持视觉的子 Agent 当”眼睛”。主模型遇到图片,自动把图交给眼睛模型看,再把文字描述拿回来继续干活。对使用者来说整个过程是无感的。

安装

首先zcode中配置好支持视觉的模型,我这里配置了opencode go中很便宜的mimo-v2.5

点击新建任务,选择不在项目中工作

新建任务

对他说

请帮我安装这个skill https://github.com/50kg/zcode-deepseek-eye

引导安装

安装好了之后重启zcode,然后新建一个对话窗口说帮我配置视觉助手

配置

告诉他使用支持视觉的模型即可。我这里使用的是opencode go 订阅中同样超低价格的mimo-v2.5

踩坑点

  • 眼睛模型选错了不用重装,重新跑一遍配置换个模型就行
  • 视觉调用走你自己的 API Key,项目本身不存任何密钥
  • 删除视觉助手后,旧会话里可能还带着”图片要交给 vision-helper”的旧规则,必须开全新会话才干净
  • 主模型本身支持视觉的话不会触发子 Agent,不会白花钱

调用过程

结语

这套方案解决了我的老毛病:既留住了 deepseek-v4-flash 的性价比,又能在需要的时候”借眼睛”看图。如果你也用纯文本模型当主力、偶尔需要识图,可以试试。

项目地址:https://github.com/50kg/zcode-deepseek-eye

不得不说zcode好好用。

zcode