Skip to content

feat/material-paper-extractor - #131

Open
shiyuasuka wants to merge 1 commit into
AgenticAIPlan:devfrom
shiyuasuka:feat/material-paper-extractor
Open

shiyuasuka wants to merge 1 commit into
AgenticAIPlan:devfrom
shiyuasuka:feat/material-paper-extractor

Conversation

@shiyuasuka

Copy link
Copy Markdown

变更信息

  • PR 类型: 业务同学提交到 dev
  • 目标分支: dev
  • 源分支: feat/material-paper-extractor
  • 涉及 Skill 列表: (仅发布 PR 填写)
  • Skill 名称: material-paper-extractor
  • Skill 路径: skills/material-paper-extractor
  • 业务场景: 从合金研究论文(PDF)中自动提取结构化的成分-工艺-微观结构-性能数据
  • 分支名: feat/material-paper-extractor
  • 本次是否由 Agent 辅助提交: 是

本次变更内容

  • 新增 material-paper-extractor Skill,实现从材料科学 PDF 论文中提取结构化 JSON 数据的完整 8 步流水线
  • 流水线包含:OCR 识别 → 文本整合 → 数据提取 → 脚本验证 → 审核 → 修订 → 对比评估(可选)→ 汇总报告
  • 新增 scripts/04-validate.py:自动校验 JSON Schema、成分总和、数值范围、YS ≤ UTS 等约束
  • 新增 scripts/08-summarize.py:聚合多篇论文的修订结果,输出 JSON / CSV / 统计报告
  • 新增 references/ 目录下的提取规则、审核、修订、评估、汇总等 Prompt 文件
  • 支持触发关键词:extract materials、parse alloy paper、材料数据提取、合金论文解析 等

验证方式

  • 准备合金研究论文 PDF,配置 PADDLEOCR_DOC_PARSING_API_URL 和 PADDLEOCR_ACCESS_TOKEN 环境变量
  • 触发关键词 extract materials 或 材料数据提取,确认 Skill 被正确加载
  • 依次执行 Step 1–8,检查各步骤输出文件是否写入正确路径
  • 运行 scripts/04-validate.py,确认验证脚本对合法 JSON 返回 Exit 0,对错误数据返回 Exit 1

补充说明

  • Step 1 依赖外部 PaddleOCR 服务,需提前配置 API 凭证(勿将 Token 提交到 git)
  • Step 7(对比评估)为条件步骤,仅在提供 {comparison_path} 时执行
  • 审核报告(Step 5)和评估报告(Step 7)需以中文输出
  • 所有子代理必须严格遵循 Output Path Rules,不得创建额外子目录

Agent 提交备注

  • 业务同学提交时,PR 目标分支必须是 dev
  • 助教发布时,只允许从 dev 提 PR 到 main
  • 公开仓库中不要填写任何个人身份信息

@ethan7zhanghx ethan7zhanghx left a comment

Copy link
Copy Markdown
Collaborator

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

阻塞性问题

Step 1 外部依赖缺失(详见 inline 评论)。


建设性建议(非阻塞性问题,可合入后再进行优化)

conda activate thl 在 Step 4 和 Step 8 中是多余的(两个脚本仅使用标准库),可直接用 python3 调用,建议清理。


业务相关性

本 skill 聚焦于从合金研究论文中提取材料科学数据,方向上与本仓库其他 skill 有所差异。如果这确实是本部门的业务需求,请忽略此评论;如果不在本仓库的收录范围内,可以考虑迁移到更合适的仓库。如有误解非常抱歉。

Co-reviewed with Claude

--file-path "{pdf_path}" \
--output "{output_base}/01_ocr/{id}.json" \
--pretty
```

Copy link
Copy Markdown
Collaborator

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

Step 1 依赖 ~/.claude/skills/paddleocr-doc-parsing,但该 skill 在本仓库及所有分支中均不存在,其他用户无法运行 Step 1。请补充该依赖的安装或获取说明,或在仓库内一并提交。

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

2 participants