跳转至

📌 后续维护待办

1. 研究起点
  • BrainStorm skill的补充,考虑如何可编程地融合背景先验知识
2. 文献检索(及元数据抓取)
  • 各文献数据库Query搜索语法的补充,尝试skill化,目前仅实现pubmed mesh部分语法先验结合
  • 从这一步开始,关于pubmed数据库解析部分,考虑BioPython库的更新与维护(E-utility的接口)。目前biopython version 1.87,详情参考biopython仓库
3. 文献获取(及全文下载)
  • paper-fetch 模块的完善封装,目前参考2026-05-08 封装paper-fetch,考虑加入或替换为更鲁棒、命中率更高的模块
  • pdf-parse 模块目前封装了mineru的简单解析指令,默认使用cpu后端(-b pipeline),后续考虑gpu等进行深入功能集成,详情参考mineru仓库
4. 文献内容提取与结构化处理
  • PMC文本内容的json结构化解析(pubmed-export-md模块),尝试加强语义边界规范检测(即扩大正则匹配边界范围),或者尝试像mineru-export-md模块一样引入AI后端
  • mineru-parse模块是针对 content_list_v2.json 文件进行解析的,但官网显示该文件解析格式仍在更新中,后续追踪维护,详情参考mineru 输出文件说明
  • mineru-parse模块,regex正则后端,尝试加强语义边界规范检测(即扩大正则匹配边界范围)
  • mineru-parse模块,ai后端,深入集成ai模块,比如说只是提取markdown的层级标题,然后让它分类,但是执行完全由python脚本执行合并
  • mineru-parse/mineru-export-md 模块的yaml配置文件进行协同优化,如何高效对应起来
  • 考虑设计1个纯skill,用于原始解析markdown内容的语段提取和结构化处理,因为我们默认行为都是使用json文件,并没有用上markdown文件
5. 其他文献数据平台的处理
  • 对于其他非pubmed数据库,也需要做一套search-fetch-parse解析方案,完善相应模块,可以参考一些开源实现paperscraperpaper-tracker
  • 多源检索合并(基建已备、编排待做):preprint/source_merge.py 已提供 merge_papers(补全缺失 DOI → 按 DOI 去重,键级联 DOI → title+authors → source_id)。尚未实现跨源编排命令;将来做 search --sources arxiv,biorxiv,medrxiv,chemrxiv 统一检索并合并为单一 corpus 时直接调用。
  • 可选连接器(按需再上):Semantic Scholar 元数据连接器暂不单独实现——与 pdf_fetch.py 内 S2(openAccessPdf/externalIds)用途重叠,避免两处维护;OpenAlex 连接器(api.openalex.org/works,abstract 倒排索引重建 + authors + citations/references)在确有「按 DOI 批量补全 metadata / 抓引用网络」需求时引入,产出 SourcePaper
  • 基础设施对齐(部分已完成):extract_doi 已统一到 source_merge.pysafe_filename 已存在(source_utils.py);get_env 因与现有扁平 os.environ.get 风格不符暂不引入;OAI-PMH 基类留到真正接入通用 OAI 仓库时再上。
6. 批判性阅读与知识图谱分析:下游终点
  • 文献深度解析,考虑加入几个高度定制化的skill,最好是可以借下游流程
  • 考虑加入数据库,考虑做大做深,不局限于纯python项目