📌 后续维护待办¶
1. 研究起点
- BrainStorm skill的补充,考虑如何可编程地融合背景先验知识
2. 文献检索(及元数据抓取)
- 各文献数据库Query搜索语法的补充,尝试skill化,目前仅实现pubmed mesh部分语法先验结合
- 从这一步开始,关于pubmed数据库解析部分,考虑BioPython库的更新与维护(E-utility的接口)。目前biopython version 1.87,详情参考biopython仓库
3. 文献获取(及全文下载)
- paper-fetch 模块的完善封装,目前参考2026-05-08 封装paper-fetch,考虑加入或替换为更鲁棒、命中率更高的模块
- pdf-parse 模块目前封装了mineru的简单解析指令,默认使用cpu后端(-b pipeline),后续考虑gpu等进行深入功能集成,详情参考mineru仓库
4. 文献内容提取与结构化处理
- PMC文本内容的json结构化解析(pubmed-export-md模块),尝试加强语义边界规范检测(即扩大正则匹配边界范围),或者尝试像mineru-export-md模块一样引入AI后端
- mineru-parse模块是针对 content_list_v2.json 文件进行解析的,但官网显示该文件解析格式仍在更新中,后续追踪维护,详情参考mineru 输出文件说明
- mineru-parse模块,regex正则后端,尝试加强语义边界规范检测(即扩大正则匹配边界范围)
- mineru-parse模块,ai后端,深入集成ai模块,比如说只是提取markdown的层级标题,然后让它分类,但是执行完全由python脚本执行合并
- mineru-parse/mineru-export-md 模块的yaml配置文件进行协同优化,如何高效对应起来
- 考虑设计1个纯skill,用于原始解析markdown内容的语段提取和结构化处理,因为我们默认行为都是使用json文件,并没有用上markdown文件
5. 其他文献数据平台的处理
- 对于其他非pubmed数据库,也需要做一套
search-fetch-parse解析方案,完善相应模块,可以参考一些开源实现paperscraper、paper-tracker- 多源检索合并(基建已备、编排待做):
preprint/source_merge.py已提供merge_papers(补全缺失 DOI → 按 DOI 去重,键级联 DOI → title+authors → source_id)。尚未实现跨源编排命令;将来做search --sources arxiv,biorxiv,medrxiv,chemrxiv统一检索并合并为单一 corpus 时直接调用。- 可选连接器(按需再上):Semantic Scholar 元数据连接器暂不单独实现——与
pdf_fetch.py内 S2(openAccessPdf/externalIds)用途重叠,避免两处维护;OpenAlex 连接器(api.openalex.org/works,abstract 倒排索引重建 + authors + citations/references)在确有「按 DOI 批量补全 metadata / 抓引用网络」需求时引入,产出SourcePaper。- 基础设施对齐(部分已完成):
extract_doi已统一到source_merge.py;safe_filename已存在(source_utils.py);get_env因与现有扁平os.environ.get风格不符暂不引入;OAI-PMH 基类留到真正接入通用 OAI 仓库时再上。
6. 批判性阅读与知识图谱分析:下游终点
- 文献深度解析,考虑加入几个高度定制化的skill,最好是可以借下游流程
- 考虑加入数据库,考虑做大做深,不局限于纯python项目