用视觉工具观察图像
ViewImage 把一张本地图片交给视觉模型,返回一段观察结果。当任务需要从截图、
示意图或照片里读出信息时用它。
前置条件
- 已经配置了视觉模型,或者有可用的支持图像输入的模型。都没有时,工具会返回
vision_adapter_unavailable。
步骤
-
让 Agent 看一个具体文件,并说明要看什么:
打开 docs/screenshots/error.png,告诉我哪个字段被高亮了。 -
Agent 用文件路径和提示词调用
ViewImage。你会拿到一段视觉观察,以及媒体 类型、字节大小、尺寸等元数据。 -
如果对同一张图、同样的提示词再问一次,运行时会复用缓存的观察结果,不再调用 模型。
确认成功
观察结果回答了你的问题,元数据也确认工具读的是你指定的那张图。
限制
支持的格式、模型选择和完整的响应结构见图像观察参考。
