data 插件:写 SQL、探索数据集、统计分析、可视化、仪表盘、数据画像、结果验证——10 个技能,连接 Snowflake/Databricks/BigQuery 等仓库。本篇是对 Anthropic 官方插件的中文转译与编目。
一句话定位
把「问题→SQL→统计→图→验证→陈述」的分析全链装进技能:方言感知的查询、按数据关系选图、交付前强制 QA 清单——最后一步「validate before presenting」是它的灵魂。
技能地图(10 技能)
查询与探索
write-query—— SQL 编写:理解需求→定方言(PostgreSQL/Snowflake/BigQuery/Redshift/Databricks 各有参考)→发现 schema→写查询→呈现代价说明→提议执行explore-dataset—— 数据画像:结构理解→列级画像→数据质量问题→关系与模式→建议维度指标→后续分析建议sql-reference—— 方言速查 + 通用模式:窗口函数/CTE 可读性/队列留存/漏斗/去重三大分析 SQL 模式
分析与可视化
statistical-analysis—— 描述统计方法论:集中趋势/离散/业务语境百分位/趋势与季节性检测/简单预测/异常检测(时序异常)/假设检验基础data-visualization—— 可视化:按数据关系选图(时间→折线、比较→条形、分布→直方图、相关→散点、构成→堆叠)+「什么时候不该用某图」反面清单 + matplotlib/Plotly 代码模式build-dashboard—— 仪表盘:需求→取数→布局设计→HTML 骨架→图表类型→交互;KPI 卡片与 Chart.js 集成模式
组织与验证
warehouse-skill-builder—— 给数据仓库自建技能:连接发现→核心问题清单→生成团队自己的 schema/指标文档→打包成技能(bootstrap 模式 + 迭代模式)——「教会你的 Claude 你们公司的数据」validate-results—— 交付前验证:方法论与假设审查→QA 清单→常见分析陷阱(辛普森悖论/幸存者偏差/相关因果)→计算复核→可视化评估→叙事评估→置信度评级(可分享/带警告分享/需返工)present-findings—— 陈述发现:分析→结构化叙事python-visualization—— Python 可视化代码模式(与小免 UI 可视化互补)
方法论精华
1. 「验证先于呈现」作为独立技能——大多数分析工具止步于出图出数;这里专门一个技能做交付前 QA:口径对不对、聚合有没有错、图有没有误导、结论是否超出数据支持范围,最后给三档置信评级。分析师的信誉是唯一资产。
2. 按数据关系选图,而非按审美:折线=时间、条形=比较、直方图=分布、散点=相关——以及反面清单(不该用饼图的时候比该用的时候多)。
3. warehouse-skill-builder 的「自举」设计:它不预置你的 schema,而是引导生成一份你们公司自己的数据字典技能——通用工具公司化的一等示范。
连接器
Snowflake、Databricks、BigQuery(预置);Definite、Hex、Amplitude、Jira(可选)。
编者注
validate-results 的常见分析陷阱清单(辛普森悖论、幸存者偏差、把相关当因果)值得每个用数据说话的人背下来。对投资研究的人:write-query + statistical-analysis + validate-results 三连就是一条迷你研究流水线。