用视觉工具观察图像

ViewImage 把一张本地图片交给视觉模型,返回一段观察结果。当任务需要从截图、 示意图或照片里读出信息时用它。

前置条件

步骤

  1. 让 Agent 看一个具体文件,并说明要看什么:

    打开 docs/screenshots/error.png,告诉我哪个字段被高亮了。
    
  2. Agent 用文件路径和提示词调用 ViewImage。你会拿到一段视觉观察,以及媒体 类型、字节大小、尺寸等元数据。

  3. 如果对同一张图、同样的提示词再问一次,运行时会复用缓存的观察结果,不再调用 模型。

确认成功

观察结果回答了你的问题,元数据也确认工具读的是你指定的那张图。

限制

支持的格式、模型选择和完整的响应结构见图像观察参考。