作者:互联网 时间: 2026-08-03 16:29:03
科研文献工作流混乱?作者开发两个Codex Skill,让文献可溯源、训练数据有边界,解决科研证据与数据合规难题。核心内容:1. 科研文献管理的核心痛点(资料分散、证据溯源难、训练数据边界问题)2. 两个Codex Skill的功能与定位(文献RAG解决证据管理,训练数据构建解决数据合规)3. 目标用户及需求(科研人员、专业团队、开发者的具体场景需求)


副标题:让文献有出处,让训练数据有边界
做科研时,我经常面对一种熟悉的混乱:
硬盘里散落着 PubMed 导出、论文摘要、PDF、Markdown 笔记和审稿资料;需要写文章时,我想快速找到证据;需要构建科研助手时,我又想把这些资料做成本地知识库,甚至进一步整理成领域模型的训练数据。
工具其实不少。PDF 可以解析,向量库可以检索,大模型也可以生成问答。
但真正让我不放心的,并不是“AI 能不能生成”,而是下面这些问题:
• 这段话究竟来自哪篇论文、哪个版本、哪一页?
• 预印本和正式发表版本是否被重复收录?
• RAG 检索到了一段文字,是否真的支持我准备写出的结论?
• 同一篇论文生成的多个问答,会不会分别进入训练集和测试集?
• 摘要、全文和人工标注究竟获准用于内部训练,还是也可以公开发布?
• AI 生成的科学标签由谁复核?审核者意见不一致时,原始判断是否还被保留?
我逐渐意识到:科研文献进入 AI 系统,缺少的往往不是另一个“生成按钮”,而是一条可追溯、可验证、可复现的数据链路。
为此,我开发了两个可以配合使用的 Codex Skill:
• DataFlow Literature RAG Skill
https://github.com/Liangshuntao/codex-dataflow-literature-rag-skill
• DataFlow Training Data Builder Skill
https://github.com/Liangshuntao/codex-dataflow-build-training-data-skill
它们分别负责两个容易被混在一起、但实际上完全不同的问题:
Literature RAG 管“证据”,Training Data Builder 管“训练样本”。
谁会真正需要这两个 Skill?
它们并不是只为专业 AI 工程师准备的。
1. 管理大量论文的科研人员和研究生
你可能正在写综述、准备基金、修改论文,或者回复审稿意见。资料越来越多,但证据仍然依赖手工复制和记忆。
你需要的不是“帮我总结一篇论文”,而是:
• 长期维护一批文献;
• 保留每条结论对应的 PMID、DOI、页码和原始文件;
• 区分预印本、正式发表版和重复记录;
• 在需要引用时能够重新找到原始证据。
2. 生物医学、药学等专业研究团队
专业领域的数据不能只追求数量。错误的证据等级、过度外推的结论以及来源不明的训练样本,都会让后续结果看似漂亮、实际不可用。
这些团队需要:
• 明确科学主张与证据片段;
• 区分直接功能证据、相关性证据和综述性证据;
• 保留独立审核和人工裁决记录;
• 控制未完成授权或科学复核的数据进入下一阶段。
3. 构建本地 RAG 或机构知识库的开发者
向量数据库“能返回内容”,不代表知识库已经可靠。
开发者还需要回答:
• 文本块能否追溯到原始文档?
• 更新索引后,文档和文本块 ID 是否仍然稳定?
• 检索效果有没有独立问题集,而不是只用论文标题自测?
• 检索命中是否被错误当作科学结论?
4. 准备领域模型数据的 LLM 数据工程师
将文献生成问答只是开始。真正困难的是:
• 如何定义训练样本的数据契约;
• 如何保留样本与原始文献的关系;
• 如何避免同源样本跨集合泄漏;
• 如何管理生成、审核、拒绝和裁决;
• 如何发布一个可以复现的数据集版本。
第一个 Skill:把散乱文献变成可追溯的证据库
DataFlow Literature RAG Skill
项目地址:
https://github.com/Liangshuntao/codex-dataflow-literature-rag-skill
它处理的是文献与检索层:
• 盘点 PubMed CSV/XML、PDF、Markdown、SOP 和研究笔记;
• 清洗、标准化和去重;
• 为文档与文本块建立稳定的 doc_id 和 chunk_id;
• 保留 PMID、DOI、页码、来源文件、检索式和文件哈希;
• 指导文档分块、向量索引、混合检索和本地 RAG;
• 使用 Hit@k、MRR 等指标评估检索效果;
• 将检索结果重新追溯到确切原文。
这个 Skill 最重要的规则是:
检索命中只是候选证据,不等于科学结论已经成立。
如果 RAG 找到一段提到“脂肪微环境”和“免疫调节”的摘要,它并不能自动证明“某个脂肪基质细胞亚群直接诱导 CD4⁺ T 细胞无反应”。
从“内容相关”到“可以支持这句话”,中间仍然需要证据等级判断、原文核对和科学审核。
因此,这个 Skill 的目标不是让模型回答得更大胆,而是让证据边界更清楚。
第二个 Skill:把获准使用的资料变成可审计训练数据
DataFlow Training Data Builder Skill
项目地址:
https://github.com/Liangshuntao/codex-dataflow-build-training-data-skill
它处理的是训练数据层,适用于:
• 预训练文本;
• SFT/指令数据;
• 多轮对话数据;
• Preference/DPO 数据;
• 科学问答和推理数据;
• 领域适应数据;
• Trainer-ready JSONL 发布。
它会要求先定义数据契约,包括:
• 模型需要学会什么行为;
• 一条训练样本的基本单位是什么;
• 输入和输出包含哪些字段;
• 来源、许可、隐私和审核状态如何记录;
• 哪些样本可以接受,哪些必须拒绝;
• train、validation 和 test 按什么单位切分;
• 最后交给训练框架的格式是什么。
随后再进入生成、筛选和审核:
• 生成或转换训练样本;
• 保留生成模型、审核者和拒绝原因;
• 进行独立盲审和版本化裁决;
• 按来源组切分数据;
• 检查重复文本和跨集合泄漏;
• 生成数据卡、manifest 和 SHA-256 校验值;
• 冻结一个不可静默修改的数据集版本。
这个 Skill 不负责选择 GPU、学习率、LoRA 参数或训练框架。
它的终点不是模型权重,而是:
一个来源清楚、分组正确、经过审核并可以交给训练流程的数据集发布包。
两个 Skill 如何联合使用?
标准流程可以概括为:
text
PubMed / PDF / 摘要 / 研究笔记
↓
DataFlow Literature RAG Skill
盘点 → 清洗 → 去重 → 分块 → 来源验证 → 检索评估
↓
冻结的 literature-to-training handoff
↓
科学审核、许可证和用途确认
↓
DataFlow Training Data Builder Skill
定义契约 → 生成样本 → 独立审核 → 裁决
→ 分组切分 → 泄漏审计 → 数据集发布
↓
独立的 LoRA / QLoRA / 模型训练流程
两个 Skill 之间不是随手复制一列文本,而是通过正式的 handoff schema 交接。
交接记录会保留:
• corpus_version
• doc_id
• chunk_id
• source_group_id
• 原始文本和证据片段
• PMID、DOI、来源文件和来源哈希
• 许可证审核状态
• 允许的使用范围
• 隐私分类
• 科学审核状态
校验器会阻止以下记录进入训练数据阶段:
• 来源无法追溯;
• 预期用途不在许可范围内;
• 科学审核尚未通过;
• 同一文献对应多个来源哈希;
• 同一文献被错误分配到多个来源组;
• “有条件许可”却没有记录具体条件。
为什么一定要按“原始文献”分组切分?
这是文献训练数据最容易忽略的问题之一。
假设一篇论文生成了 20 条问答。如果直接随机切分,其中 16 条可能进入训练集,另外 4 条进入测试集。
测试问题虽然没有逐字出现在训练集中,但模型已经见过同一篇论文的内容、结论和表达方式。最后得到的测试成绩,很可能高估模型面对真正新文献时的能力。
因此,这套工作流要求:
同一篇论文产生的文本块、问题、回答、改写和负样本,必须共享同一个 source_group_id,并留在同一个数据集合中。
如果多个文档属于同一病例、同一对话、同一题目家族或同一研究项目,还应该使用更严格的家族级分组。
典型使用场景
场景一:建立个人或课题组的文献助手
把 PubMed 导出、PDF 和研究笔记整理成本地知识库,检索结果保留 DOI、PMID、页码与原文件。
这时主要使用 Literature RAG Skill,不一定需要进入训练数据阶段。
场景二:为论文写作建立 claim–evidence ledger
针对 Introduction、Discussion 或审稿意见,将每条科学主张与证据片段、证据等级和允许措辞关联起来。
它可以帮助研究者识别:
• 哪些文献只能作为背景支持;
• 哪些文献具有直接功能证据;
• 哪些结论仍属于相关性或假说;
• 哪些措辞超出了摘要或实验能够支持的范围。
场景三:从文献构建专业 SFT 问答
先在 Literature RAG Skill 中完成来源、版本和权限治理,再将获准使用的文献快照交给 Training Data Builder。
随后完成:
• 问答生成;
• 证据片段绑定;
• 独立审核;
• 人工裁决;
• 来源组切分;
• 泄漏审计;
• 数据集发布。
场景四:构建机构内部的专业知识助手
对于不能上传到公共云端的 SOP、内部文档和研究资料,可以在明确隐私与网络边界后建立本地语料库。
只有经过用途批准的内容,才进入内部训练数据阶段;允许检索并不自动等于允许训练或重新发布。
场景五:微调模型后继续保留 RAG
微调和 RAG 并不是二选一。
• 微调适合学习稳定的回答方式、格式和领域判断规则;
• RAG 适合提供不断更新的论文、精确引用和正式发表状态。
即使完成领域微调,仍然应该保留文献 RAG,避免把容易变化的事实完全固化在模型权重中。
可以怎样开始使用?
建立文献库
text
使用 dataflow-literature-rag,把这些 PubMed CSV 和 PDF
建成一个可追溯的本地检索语料库。
审计已有 RAG
text
检查这个文献 RAG 是否缺少 PMID、DOI、页码、来源哈希,
并使用独立证据问题评估检索效果。
联合构建训练数据
text
把这批文献建立成可追溯语料库,
完成来源、许可和科学审核后,
交接给 dataflow-build-training-data,
生成内部训练用 SFT 数据。
发布冻结版本
text
按原始文献进行来源组切分,
检查 train、validation 和 test 之间的来源与文本泄漏,
生成数据卡、manifest、校验值和 trainer handoff。
它们不能替代什么?
为了避免误解,这两个 Skill 都有明确边界:
• 它们不能代替机构法务或数据授权人员作出许可决定;
• 检索器不能代替科学专家判断证据是否支持某个结论;
• AI 审核不能完全代替关键科学数据的人工复核;
• Training Data Builder 不负责运行 LoRA/QLoRA;
• 两个 Skill 都不用于分析 Seurat、Scanpy 等原始组学对象。
它们做的是把流程中的来源、判断、权限、版本和质量检查显式化,而不是承诺“一键得到正确模型”。
写在最后
现在很多 AI 项目都在追求更大的模型、更多的数据和更复杂的 Agent。
但在科研场景中,我更关心几个朴素的问题:
• 证据从哪里来?
• 这句话究竟能不能这样写?
• 这份资料是否允许这样使用?
• 数据集是怎样生成和审核的?
• 测试结果是否被同源数据泄漏夸大?
• 半年以后,我们还能不能复现今天的数据版本?
这两个 Skill 的目标,就是把这些问题纳入日常 Codex 工作流。
一个让文献“找得到、追得回”,一个让训练数据“能训练、可审核”。
如果你也在构建科研文献库、领域 RAG 或专业训练数据,欢迎试用并提出反馈。
• DataFlow Literature RAG Skill
https://github.com/Liangshuntao/codex-dataflow-literature-rag-skill
• DataFlow Training Data Builder Skill
https://github.com/Liangshuntao/codex-dataflow-build-training-data-skill
这两个项目是独立社区项目,并非 OpenDCAI/DataFlow 或 OpenAI 官方项目。
登录查看剩余 70% 内容