ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

oh-my-pi 图像工具全解:generate_image 生成与 inspect_image 分析

oh-my-pi 图像工具全解:generate_image 生成与 inspect_image 分析 oh-my-pi 图像工具全解generate_image 生成与 inspect_image 分析【免费下载链接】oh-my-pi⌥ Coding agent with the IDE wired in项目地址: https://gitcode.com/GitHub_Trending/oh/oh-my-pioh-my-pi 是一个把 IDE 深度接进终端的 AI 编程智能体Coding agent with the IDE wired in除了读写代码和跑命令它内置了两个强大的图像工具generate_image负责 AI 图像生成与编辑inspect_image负责用视觉模型分析本地图片。这篇指南带你快速上手这两个图像工具看懂配置、模式、限制与常见报错几分钟就能让智能体会画图、会看图。 一、为什么编程智能体需要图像工具写代码的人同样离不开图片项目里要一张架构图、README 需要配图、UI 上线后想分析截图找 bug、文档里有一张报错弹窗想 OCR 出文字。过去你需要切到网页版画图、把截图发给聊天机器人再复制结果回来。oh-my-pi 把这两件事做成了智能体的原生工具generate_image文生图、图生图编辑、图内文字渲染输出自动存为临时文件inspect_image把本地图片或本轮粘贴的附件交给视觉模型返回文字分析结果。两个工具与read、bash等 31 个内置工具同处一个命名空间智能体在会话中可以自行决定何时调用。完整工具清单见项目 README.md。️ 二、generate_imageAI 图像生成与编辑2.1 快速上手先开启这个工具generate_image默认关闭需要在设置中显式启用generate_image.enabledtrue并且会话的工具过滤列表中包含它时才会注册。它的实现入口在 image-gen.ts面向模型的提示词在 image-gen.md。2.2 六种生成模式一个工具全搞定模式用法要点文生图只给subject主提示词可加style、composition、lighting等字段图像编辑提供input输入图 changes修改说明多张图在subject中分别命名为 Image 1、Image 2图内文字使用text字段渲染短文字并建议加sharp, legible, correctly spelled提示指定供应商provider字段指定后端如openai、gemini、xai等常用宽高比支持1:1、3:4、4:3、9:16、16:9其中3:2和2:3仅 xAI 支持分辨率支持1024x1024、1536x1024、1024x1536三档。2.3 支持哪些后端自动降级是亮点generate_image按以下顺序挑选供应商本次请求指定的provider→ 设置里providers.imageOrder的顺序 → 当前会话模型对应的图像供应商 → 内置顺序openai、openai-codex、antigravity、xai、openrouter、gemini。关键设计某家供应商 HTTP 失败时会自动尝试下一家直到成功或全部失败才报错本地文件错误、超时、取消则直接抛出不做降级。整个请求有 3 分钟超时保护。2.4 输出与限制一览生成的图片保存为系统临时目录下的omp-image-编号.扩展名文件OpenAI 后端请求 WebP 格式返回路径 base64 元数据本地输入图上限35 MiB按文件头嗅探类型改个.png后缀不算数xAI 编辑模式最多接受3 张参考图供应商返回没有图像数据时正常返回imageCount: 0而不是报错。详细字段与报错说明见官方文档 generate_image.md。 三、inspect_image让视觉模型读你的图片3.1 激活逻辑当前模型看不见时自动上线与generate_image相反inspect_image默认是mode: auto当你的活动模型不支持图像输入时自动注册支持原生识图的模型则默认不上可以直接把图发过去。也可以手动设为on/off配置模式定义在 settings-schema.ts实现入口在 inspect-image.ts。3.2 输入只有两个参数却支持三种来源inspect_image只接受path和question两个参数path可以是本地文件路径相对会话工作目录解析Image #N附件标签直接引用本轮粘贴/上传的第 N 张图attachment://N或image://NURI同上。question建议写清楚三件事检查目标、约束如逐字引用图中文字、输出格式列表/表格/JSON。官方提示词见 inspect-image.md。3.3 格式、大小与自动压缩项目限制/行为支持格式PNG、JPEG、GIF、WebP按文件头检测不看扩展名大小上限20 MiB超限在调用模型前直接报错自动压缩images.autoResize开启时超过 1568×1568 或 500 KiB 的图会降采样重编码目标 JPEG 质量 80失败则原样上传请求超时默认 5 分钟inspect_image.timeoutMs设为 0 关闭模型选择依次尝试vision→default→ 当前会话模型 → 模型列表首个且模型必须声明支持图像输入一个实用细节自动压缩可能改变上传的 MIME 类型——一张 GIF 输入最终可能以 PNG/JPEG/WebP 中最小的编码结果上传对大多数视觉模型都更友好。⚙️ 四、配置速查最快启用方法常用开关汇总{ generate_image: { enabled: true }, // 默认 false需手动开启 inspect_image: { mode: auto }, // auto | on | off默认 auto images: { autoResize: true, // 大图自动降采样 blockImages: false // 为 true 时禁止一切图像提交 } }想用generate_image开启开关 至少配置一个供应商的 API 凭据登录 OpenAI/ChatGPT、Anthropic、Gemini 或填 xAI/OpenRouter key 均可无凭据会直接提示No image API credentials found想用inspect_image确保有一个支持图像输入的模型并配置好凭据模型选择顺序见上文 3.3。完整设置项说明见 settings.md。 五、常见报错与排查报错信息原因与解法No image API credentials found...没有任何图像供应商凭据按提示配置 key 或登录Image file too large输入超过 20 MiBinspect或 35 MiBgenerate 输入图先压缩only supports PNG, JPEG, GIF, and WEBP文件头嗅探失败不是这四种格式does not support image input视觉模型不支持图像输入为modelRoles.vision配置一个能识图的模型No image attachments are available in this turn用Image #N引用了附件但本轮没有粘贴图片所有供应商均 HTTP 失败工具会抛出列出全部已尝试供应商及各自错误的聚合错误逐个排查 六、典型场景示例README 配图直接说用 generate_image 给我项目画一张 16:9 的架构示意图产物落在临时目录智能体会告诉你路径拷走即可UI 调试把界面截图粘贴进会话让智能体用 inspect_image 找出这个表单里对不齐的元素并逐字引用报错文字设计技能联动oh-my-pi 的技能市场里还有graphics-design这类技能可结合 React Tailwind 渲染生产级静态图适合需要可复现配图的场景。✅ 总结generate_image是开关式工具enabledtrue后提供文生图、编辑、文字渲染三种模式多供应商自动降级3 分钟超时inspect_image是自动式工具当前模型看不见图时自动上线支持本地文件与Image #N附件20 MiB 上限 自动压缩两个工具分别对应产出图像与理解图像配合视觉模型配置让 oh-my-pi 从纯文本编程智能体升级成能看图、能画图的完整工作台。【免费下载链接】oh-my-pi⌥ Coding agent with the IDE wired in项目地址: https://gitcode.com/GitHub_Trending/oh/oh-my-pi创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表