banner
约 600 字
2 分钟

一句话让你的OpenCode学会全局识图

摘要

通过一个全局 Skill,让 OpenCode 具备全局识图能力,遇到图片自动调用视觉模型描述,无需切换模型,简单粗暴一劳永逸。

前言

之前让 OpenCode 学会了制作图片,但每次结尾都会提示它自己看不到,图片调整起来就不太方便,虽然可以通过切换模型的方法达到识图的目的,但是很麻烦,操作起来不顺畅。

创建 skill

找到一个 skill,可以解决这一问题,把下面这段话发给 OpenCode

纯文本
请在 https://github.com/asuojun/claude-vision-skill  中搜索并完整阅读 asuojun/claude-vision-skill,把它改造成 opencode 的全局识图 Skill,安装到用户级全局 Skill 目录,名称使用 deepseek-vision,让所有项目都能调用。
不要只完成安装,还要加两层规则级强制:
一是更新 deepseek-vision 的 SKILL.md,明确任何任务出现附件、粘贴截图、本地图片路径或网络图片 URL 时,都必须先调用这个 Skill。
二是更新 opencode 用户级全局 AGENTS.md,明确遇到图片必须先调用 deepseek-vision,禁止用 OCR、Read、文件信息检查或其他本地图像处理代替。只有识图失败后,才允许 OCR 做补充诊断。不要只写进当前项目。
视觉模型固定使用opencode自带的 MiMo V2.5 Free 。
最后提醒我换到另一个项目,新建一个全新的 OpenCode 任务再贴图验证。不要使用当前旧任务作为最终验证,所有新项目任务遇到图片时,必须先调用 deepseek-vision,而不是 OCR。

测试

069ac675e9b642c2.png

还是用这张小猫的图片,让 AI 生成图片描述

4d47019ad73471d4.png

可以看到描述的很详细。

9da974950f7ac100.png

结尾

这个方法同样适用于所有 ai agent ,而且简单粗暴一劳永逸,非常适合小白使用。

END