八件工具与媒体技能:playwright×2(浏览器自动化)、jupyter、pdf、screenshot、speech(语音合成)、transcribe(语音转写)、imagegen(图像生成)、cli-creator(从 API 文档造 CLI)——Codex 的「手和眼」。
一句话定位
感知与执行的末端全部技能化:看浏览器(playwright)、看屏幕(screenshot)、读论文(pdf)、算数据(jupyter)、听与说(transcribe/speech)、画图(imagegen)——外加一件元工具:从任何 API 文档给 Codex 造一个 CLI。
八件精要
playwright / playwright-interactive —— 浏览器自动化双件:终端驱动的真实浏览器(导航/填表/快照)+ js_repl 里的持久浏览器会话(快速迭代式 UI 调试)——一次性任务与长会话调试两种形态
screenshot —— 桌面/系统级截图:全屏、特定应用/窗口、区域——「用户明确要求时」触发(屏幕访问的严格门槛)
jupyter-notebook —— 创建/脚手架/编辑 .ipynb:实验与探索的载体技能
pdf —— 「渲染与排版要紧时」的 PDF 读取/创建/审查——优先视觉保真路径(与 Anthropic pdf 的「全操作」定位差异在侧重点)
speech —— 文本转语音:旁白/配音/无障碍朗读/音频提示,批量合成
transcribe —— 语音转写:可选说话人分离(diarization)与已知说话人提示——会议与访谈的入口技能
imagegen —— 位图生成/编辑:照片、插画类视觉任务
cli-creator ·(本组最有趣) —— 从 API 文档/OpenAPI spec/curl 示例/SDK/Web 应用,为 Codex 组装一个可组合 CLI——把「读文档拼命令」变成「造工具再用」
方法论精华
1. 「手眼」分类法:八件按感知(screenshot/playwright/pdf/transcribe)与执行(speech/imagegen/jupyter)分——agent 的能力清单就该按「能感知什么、能做什么」两轴列。
2. cli-creator 的元工具价值:不为每个 API 写技能,而是造一个把 API 变成工具的工具——一次投入,N 个 API 受益,是「造工具的工具」在集成层的镜像(对照 Anthropic 的 mcp-builder)。
3. 触发门槛的分级:screenshot「用户明确要求才触发」vs playwright「任务需要就触发」——权限越敏感,触发越严格,安全意识藏在触发条件里。
编者注
对照 Anthropic 的文档四件套(docx/pdf/pptx/xlsx):OpenAI 的媒体件偏「输入侧感知」(听/看/读),Anthropic 偏「输出侧工艺」(做文档)——两家的「手」长在不同的胳膊上,这行观察会在 07 的对比篇展开。