↩ 研究与项目/Codex 技能 Primer

05 · 工具与媒体件 Primer

The Codex Skills Catalog Primer · 05

八件工具与媒体技能:playwright×2(浏览器自动化)、jupyter、pdf、screenshot、speech(语音合成)、transcribe(语音转写)、imagegen(图像生成)、cli-creator(从 API 文档造 CLI)——Codex 的「手和眼」。


一句话定位

感知与执行的末端全部技能化:看浏览器(playwright)、看屏幕(screenshot)、读论文(pdf)、算数据(jupyter)、听与说(transcribe/speech)、画图(imagegen)——外加一件元工具:从任何 API 文档给 Codex 造一个 CLI。

八件精要

playwright / playwright-interactive —— 浏览器自动化双件:终端驱动的真实浏览器(导航/填表/快照)+ js_repl 里的持久浏览器会话(快速迭代式 UI 调试)——一次性任务与长会话调试两种形态

screenshot —— 桌面/系统级截图:全屏、特定应用/窗口、区域——「用户明确要求时」触发(屏幕访问的严格门槛)

jupyter-notebook —— 创建/脚手架/编辑 .ipynb:实验与探索的载体技能

pdf —— 「渲染与排版要紧时」的 PDF 读取/创建/审查——优先视觉保真路径(与 Anthropic pdf 的「全操作」定位差异在侧重点)

speech —— 文本转语音:旁白/配音/无障碍朗读/音频提示,批量合成

transcribe —— 语音转写:可选说话人分离(diarization)与已知说话人提示——会议与访谈的入口技能

imagegen —— 位图生成/编辑:照片、插画类视觉任务

cli-creator ·(本组最有趣) —— 从 API 文档/OpenAPI spec/curl 示例/SDK/Web 应用,为 Codex 组装一个可组合 CLI——把「读文档拼命令」变成「造工具再用」

方法论精华

1. 「手眼」分类法:八件按感知(screenshot/playwright/pdf/transcribe)与执行(speech/imagegen/jupyter)分——agent 的能力清单就该按「能感知什么、能做什么」两轴列。

2. cli-creator 的元工具价值:不为每个 API 写技能,而是造一个把 API 变成工具的工具——一次投入,N 个 API 受益,是「造工具的工具」在集成层的镜像(对照 Anthropic 的 mcp-builder)。

3. 触发门槛的分级:screenshot「用户明确要求才触发」vs playwright「任务需要就触发」——权限越敏感,触发越严格,安全意识藏在触发条件里。

编者注

对照 Anthropic 的文档四件套(docx/pdf/pptx/xlsx):OpenAI 的媒体件偏「输入侧感知」(听/看/读),Anthropic 偏「输出侧工艺」(做文档)——两家的「手」长在不同的胳膊上,这行观察会在 07 的对比篇展开。

← Notion 知识链与 GitHub 工作流 Primer
系统层与元技能 Primer →