life-sciences 插件 6 技能:nf-core 生物信息流水线、单细胞 RNA QC、scvi-tools 深度学习整合、仪器数据标准化(Allotrope)、临床试验方案、科研问题选择——湿实验室之外的干实验全栈。
一句话定位
给生物研究装上计算基建:测序数据过 nf-core 流水线、单细胞数据做 QC 与深度学习整合、仪器输出标准化成通用格式、试验方案按模板生成——每个技能都带「环境自检 + 测试先行」的工程纪律。
六技能精要
nextflow-development · 生信流水线
- 跑 nf-core 的 rnaseq/sarek/atacseq 管线处理 RNA-seq/WGS-WES/ATAC-seq
- 与 cowork 12 篇的 genomics-pipeline 同源——测试 profile 先行、环境排障(Docker/Java/Nextflow)前置
single-cell-rna-qc · 单细胞质检
- .h5ad/.h5 文件的 QC:scverse 最佳实践 + MAD 过滤(中位数绝对偏差的统计过滤法)
- 双路径:完整 QC 管线(标准流程)或模块化积木(自定义流程)
scvi-tools · 深度学习整合
- 单细胞分析的深度学习:批次整合(不同实验/平台的数据对齐)与数据集成
instrument-data-to-allotrope · 仪器数据标准化
- 实验室仪器输出(PDF/CSV/Excel/TXT)→ Allotrope Simple Model(ASM)JSON 或扁平 2D CSV
- 仪器数据的通用格式化——与 cowork 12 篇的三级解析策略同源
clinical-trial-protocol-skill · 试验方案
- 医疗器械或药物的临床试验方案生成(与 healthcare 共享)
scientific-problem-selection · 科研选题
- 研究问题选择、项目构思、卡住项目的排障——科学家的思考伙伴
方法论精华
1. MAD 过滤的统计纪律——单细胞 QC 用中位数绝对偏差而非固定阈值:生物数据的「异常」标准必须随数据分布自适应,硬阈值在批间效应面前全线失守。
2. 标准格式的战略价值(Allotrope):仪器数据统一成 ASM——格式标准化是一切下游自动化(QC、建模、整合)的前置;没有它,每个仪器一个解析器是永远修不完的坑。
3. 双路径技能设计:QC 提供「完整管线」与「模块积木」两用法——新手走管线、老手拼积木,一个技能服务两种成熟度。
4. 「卡住项目排障」作为技能——科研的隐性痛点不是不会做是不会继续做:把「项目卡住的诊断」显式化为技能(与 legal 的 cold-start 类似的元层设计)。
编者注
六技能 = 计算基建(流水线+QC+整合)+ 数据基建(标准化)+ 文档基建(方案)+ 元层(选题排障)。对 AI+Science 感兴趣的读者:这个仓库和 bio-research 插件合起来,就是 Anthropic 对「科学自动化」的完整答卷——先标准化,再自动化,最后才谈智能。