Files
mdpolish/research-wiki/scratch/data-5papers-cleaning-audit-2026-08-21.md
T
Bepr4 977bfb832b 建立实验室共用库定位并完成论文/GovDoc 两批数据的问题审计
- README 更新项目定位为实验室共用清洗库,明确 data/ 职责与 profile 复用原则;
- 新增 ClinDB-ReviewBench(论文清洗)5 份 Markdown 问题审计(scratch),
  并确定第一版清洗范围:9 类确定性规则(reference/CLINDB_REVIEWBENCH_CLEANING_SCOPE.md);
- 45 份政务文档审计重命名为 GOVDOC_SAAS_CLEANING_SCOPE.md,截去第 6 节起的
  实施建议,只保留问题报告(396 行);
- 收录 2026-08-20 生态调研草稿(scratch)。
2026-08-21 17:44:23 +08:00

226 lines
17 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# data/ 五份论文 Markdown 审计报告(2026-08-21
> 状态:scratch 草稿,供评审。清洗力度由师姐逐项决定,本报告只列问题、证据和可选处置,不做力度决策。
## 1. 结论摘要
- 五份文件均为英文学术论文的 PDF→Markdown 转换产物,分属 5 个来源(JAMA、EJHF、Statistics in Medicine/arXiv、Springer/arXiv、Disaster Med Public Health Preparedness),噪声特征差异很大,不能用一套固定规则覆盖。
- 最严重的问题不是格式噪声,而是**内容丢失**:2 份文件中途截断,1 份(JAMA)所有表格整体缺失。这类问题清洗无法恢复,只能重新转换或人工补录。
- JAMA 文件的原始 PDF 是**未定稿的 Word 修订稿**,行号、审阅批注、修订残留词对全部泄漏进正文,是五份中污染最重的。
- 格式类噪声(双重转义实体 31 处、孤行公式编号 12 处、空行断句、标题层级扁平、引用上标混用等)确定可清洗,风险低。
- 少数问题涉及**语义改变**(数学公式被 OCR 改错、乱码替换专名),自动清洗有改错正文的风险,建议人工确认。
## 2. 审计范围与方法
- 对象:`data/*/markdowns/*.md` 共 5 份,逐行人工通读;行号均指 markdowns 下的 md 文件。
- 辅助统计(本轮实际执行):标题层级计数、图片/表格/实体/批注/arXiv 戳的 grep 计数。
- 判定原则:只把"转换管线引入的噪声"列为清洗对象;原文自身的写作瑕疵(如语法错误)不属于转换噪声,单独列出并标注"不建议清洗"。
- 未验证项:未与原 PDF 逐页比对内容完整性,"缺失"结论基于文内自引用(如正文提到 Table 2 但全文无 Table 2)和文件截断位置。
## 3. 总体统计
| 文件(下文简称) | 行数 | H1 | H2 | H3+ | 图片 | HTML表格 | 双重转义 | 孤行编号 | 批注 | arXiv边栏戳 |
|---|---|---|---|---|---|---|---|---|---|---|
| dmp (Disaster Med) | 208 | 0 | 11 | 0 | 1 | 7 | 23 | 0 | 0 | 0 |
| jama (JAMA 2024) | 349 | 2 | 10 | 0 | 0 | 0 | 0 | 0 | 2 | 0 |
| ejhf (EJHF 2020) | 143 | 1 | 13 | 0 | 1 | 1 | 8 | 0 | 0 | 0 |
| sim (Stat Med/arXiv) | 247 | 2 | 11 | 0 | 2 | 0 | 0 | 12 | 0 | 1 |
| springer (ICU LSTM) | 154 | 1 | 12 | 0 | 4 | 1 | 0 | 1 | 0 | 1 |
补充:jama 有 128 行以"行号+空格"开头(手稿行号泄漏);springer 的 3 处 arXiv 字符串中 2 处是参考文献的正常引用,仅 1 处是边栏戳。
## 4. 问题清单
每项标注:【确定】= 确定是转换噪声,可安全清洗;【语义】= 涉及内容判断,建议人工确认;【丢失】= 内容缺失,清洗不可恢复。处置选项仅供师姐选择。
### A. 内容级问题(最严重)
**A1【丢失】两份文件中途截断**
- ejhf 第 143 行在 Table 1 HTML 表格中间戛然而止("Medical history at randomization, no. (%)" 行后为空单元格)。Table 1 后半、Tables 2–4、全部图注、参考文献整体缺失。
- sim 第 247 行止于方法 M5 描述中间,且结尾 URL 损坏(`https://cran.r-project.org/web/p6$^{10}$`)。第 3 节(结果)、4、5 节、参考文献、附录缺失。
- 处置选项:a) 退回重新转换;b) 接受现状并在元数据标记"截断";c) 人工补录缺失部分。清洗管线本身无法解决。
**A2【丢失】jama 全部表格缺失**
- 正文多处引用 Table、Box 1、eTables 13,但全文 0 个表格、0 张图片。摘要性内容(如各器官系统阈值表)完全丢失。
- 处置选项:同 A1。
**A3【丢失】dmp 的 FIGURE 1 流程图被转成 HTML 表格**
- 第 83 行:流程图(决策树)被输出为单行 HTML 表格,图形语义尽失,仅 FIGURE 2(第 111 行)保留为图片。
- 处置选项:a) 保留现状(有总比没有好);b) 重新转换该页;c) 人工用图片替换。
**A4【丢失】sim 第 93 行句子开头缺失**
- "/unpenalized) regression models" 以斜杠开头,前文整句丢失。
- 处置选项:标记为损坏片段,或对照原文补录。
### B. 草稿/修订痕迹泄漏(仅 jama,原稿是 Word 修订稿)
**B1【确定】手稿行号泄漏(128 行)**
- 正文行以行号开头:"25 increase in the Sequential..."(第 115 行)、"26 with suspected infection"(第 116 行)等;标题也带行号:"## 116 Results/recommandations"(第 149 行)、"## 117 Criteria..."(第 151 行)、"## 143 Organ dysfunction..."(第 165 行)。
- 处置选项:a) 剥离行首行号(注意与正常编号列表、年份区分);b) 连同批注一起整体退回,要求提供定稿版。
**B2【确定】审阅批注泄漏(2 处)**
- 第 155157 行:"Commented [LS1]: Why highlighted?"、"Commented [SW2R1]: To make sure we use capital letters..."。
- 处置选项:整段删除。注意第 292 行还有一句删除文字与保留文字混杂的句子("Appropriate process and balancing measures Efforts to enhance..."),需人工断句。
**B3【语义】Word 修订残留词对(约 7 处)**
- "defined identified by as"(第 91 行)、"defined identified using by"(第 153 行)、"defined identified as in sepsis-septic patients"(第 116 行)、"defined indicate by as"(第 163 行)、"was were derived"(第 306 行)、"The new-Phoenix"(第 197 行)等——是"插入词+删除词"并存的痕迹。
- 哪个词是最终保留词需要对照定稿判断,自动二选一有风险。处置选项:a) 人工逐处确认;b) 退回要定稿。
**B4【确定】未填占位符**
- "XX societies"(第 101 行)、"XX-microbiological testing and YY-antibiotics"(第 302 行)、"Endorsing societies: To be populated after acceptance"(第 317 行)。
- 处置选项:保留并标记待补,或等定稿填充后再清洗。
**B5【确定】日期损坏**
- 第 85 行 "Revision date: December 3122, 2023"。
- 处置选项:对照原文改为 2023 年内正确日期(人工)。
### C. 标题结构问题
**C1【确定】标题层级扁平**
- dmp0 个 H111 个 H2 全部同级(含 Introduction/Methods/Results 等,第 1,3,7,59,67,103,137,153 行)。
- ejhf:主章节与子章节同为 H2"## Methods" 第 51 行、"## Study population" 第 53 行),无层级区分。
- 处置选项:按章节编号/语义推断层级(2.1 → H3),或统一降级保持平级。前者需人工核对推断结果。
**C2【确定】标题被拆分成两行**
- jama:标题拆成两个 H1(第 12 行 "International Consensus Criteria..." / "The Phoenix Pediatric Sepsis Criteria",实为正副标题)。
- sim:主标题拆成两个 H1(第 34 行 "Conounder selection..." / "treatment effect estimators",且首词 "Conounder" 是 OCR 错字,原文应为 Confounder);2.2 节标题拆两行(第 183/185 行 "…full matching on the propensity" / "## score")。
- 处置选项:合并为单标题;sim 主标题的 "Conounder" 拼写需对照原文确认(【语义】)。
**C3【语义】乱码标题**
- dmp 第 47 行 `## ่วง`(泰文字符)。按位置推断应为 METHODS,但不能凭推断改写正文级内容。
- 处置选项:人工对照 PDF 改回,或删除该标题。
**C4【确定】跑动页眉混入正文且被标为标题**
- dmp 第 73、191 行 "## MSOFA Score for Critical Care Triage" 出现在句中和 REFERENCES 内;第 71→75 行一句话被它从中间切断。
- 处置选项:删除页眉行并把被切断的句子接回。
### D. 表格问题
**D1【确定】表格压缩为单行 HTML**
- 全部 9 个表格(dmp 7、ejhf 1、springer 1)都是 `<table>...</table>` 单行输出,diff、review、编辑都极难。
- 处置选项:转 GFM 多行表格(简单表);对含 rowspan/colspan 的复杂表保留 HTML 但格式化缩进。
**D2【确定】HTML 实体双重转义(31 处)**
- dmp 23 处(`&amp;gt;400``&amp;lt;1.2``MAP&amp;lt;70`,第 27/33/39 行等);ejhf 8 处(`A1C&amp;lt;7``7≤A1C&amp;lt;8`,第 143 行)。
- 处置选项:还原一层转义(`&amp;gt;``>`)。这是最安全的清洗之一。
**D3【确定】合并单元格信息丢失**
- dmp 第 33 行 Table 2 的 Liver 行出现空 `<td></td>`,跨行合并关系丢失,数值与表头对应断裂。
- 处置选项:对照 PDF 人工修复合并结构,或标记为低可信表格。
**D4【确定】表格行错误合并**
- dmp 第 39 行 Table 3:四个器官系统 "Respiratory Coagulation Liver Cardiovascular" 被挤进一个单元格。
- 处置选项:人工拆分修复。
**D5【确定】表头 OCR 乱码**
- springer 第 111 行 Table 1 表头 "Claesther"(应为 Classifier)。
- 处置选项:人工改正(单处,低成本)。
### E. 文本级损坏
**E1【语义】跨脚本字符替换**
- dmp 第 43 行 "atينS Hospital"、第 55 行 "ينDS Hospital"——阿拉伯字符 ين 替换了 "LD"LDS Hospital 是机构专名)。
- 处置选项:人工替换回 "LDS"。自动规则可检出非拉丁字符混入,但替换动作建议人工确认。
**E2【确定】跨页断词**
- dmp:第 125 行结尾 "…at the relevant thresh" + 第 127 行 "olds of 8 and 11"(单词 thresholds 被页边界切开)。
- sim:第 87/89 行 "except possi-" / "bly via treatment";第 217/219 行 "cre-" / "ated by permuting"。
- 处置选项:拼接断词(去连字符合并)。需注意英语中合法的行尾连字符(如 "well-known")不能误合并,建议只合并"行尾连字符+下一行首为小写字母且拼出的词在词表内"的情况,其余保留待审。
**E3【确定】句内空行断句**
- 大量段落被空行从句子中间切开:jama 第 103→105、113→115 行;ejhf 第 4749、5759、6769、8789、113115、131133 行;springer 第 16→20 行(中间还被 arXiv 戳隔开,见 H1)、42→44 行。
- 处置选项:段内合并(前段末无句号且后段首为小写/连接词时拼接)。这是对 RAG 分块影响最大的问题之一。
**E4【确定】段落内容错位/孤立行**
- springer 第 63 行孤立 "1"(公式编号漂移,见 F1);第 8183 行 "…improve the simple Multilayer Perceptron… other deep models." 后接 "including RNNs and MLPs.",段落被错误切开。
- 处置选项:结合上下文人工归位。
### F. 数学公式问题(sim 最重,springer 次之)
**F1【确定】公式编号漂移成孤行**
- sim 12 处:第 63/70/81/107/117/133/145/153/161/171/179/197 行分别是 "1"、"2"、"(4)"…"(12)"springer 第 63 行 "1"。
- 处置选项:并入对应公式块或删除(若公式本体已带编号)。需逐处对照,不宜盲目删除。
**F2【语义】公式内容被 OCR 改错**
- sim 第 139 行 `$\exp(x) = \exp(x)/\{1+\exp(x)\}$`——这是 expit 函数定义(x↦e^x/(1+e^x)),左边的 $\exp(x)$ 应为 $x$ 或 expit(x)。OCR 错误改变了数学含义,且这种错误会误导下游读者。
- 处置选项:人工对照原文修复;自动工具只能标记"公式与上下文不符",不宜自动改。
- sim 第 119 行 "weights w k" 下标丢失,同类。
**F3【确定】LaTeX 冗余空格与风格不一**
- sim 全文行内公式带前导空格(`$ \widehat{\psi}_{j} $`)、内部空格过多(`\widehat { \mathrm { E } } ( Y ^ { a } )`,第 150 行)。
- 处置选项:规范化空格(不改变符号语义的前提下)。风险低但需保守,避免动 `\,` `\;` 等有意义的间距命令。
**F4【确定】公式 OCR 字符间距拉宽**
- springer 第 72/78 行 cases 环境里 `\mathrm { s u r v i v o r s ~ g r o u p }` 逐字空格。
- 处置选项:去除字母间空格(保守做法:只处理 `\mathrm{}` 内的单字母间距模式)。
### G. 格式不一致
**G1【确定】引用上标风格混用**
- 同一文件内 LaTeX `$^{1,2}$` 与 Unicode 上标(¹²、²⁻⁴、⁴⁹ ⁵⁰,⁵¹)并存:jama(第 115116 行 Unicode vs 第 107/187 行 `$\geq 2$`)、ejhf(第 4549 行 LaTeX vs 第 133 行 Unicode)、springer(第 56 行 `$ ^{1} $` vs 第 20 行 [1,2,4,3] 方括号)。
- 处置选项:统一为一种(选哪种由师姐定,取决于下游用途:RAG 检索倾向 Unicode 纯文本,渲染倾向 LaTeX)。
**G2【可能】数字格式不一致**
- ejhf 第 55/57 行 "6068 patients" vs "4,091 patients"dmp 第 91 行 "0.81-.85"(小数点前缺 0)。
- 注意:springer 的 "61.532"、"46.520" 是欧式千分位,可能是原文排版而非转换噪声,不能自动统一。
- 处置选项:统一千分位与小数风格;欧式写法是否转换需师姐定。
**G3【确定】参考文献列表分隔不一致**
- dmprefs 118 空行分隔,1933 连续堆叠(第 193208 行);springerrefs 18 空行分隔,919 连续堆叠(第 140–154 行)。
- 处置选项:统一为一条一空行。
### H. 非正文噪声与资产
**H1【确定】arXiv 边栏戳**
- sim 第 1 行 "arXiv:2001.08971v3 [stat.ME] 10 Oct 2020"springer 第 18 行同类戳插在 Introduction 段落中间,把一段话切成三截(第 16/18/20 行)。
- 处置选项:删除戳行并接回段落。注意别误删参考文献中的合法 "arXiv preprint arXiv:…"springer 第 143/152 行)。
**H2【确定】机构仓库封面页**
- ejhf 第 111 行:Glasgow eprints 引用说明、版本声明、`http://eprints.gla.ac.uk/213358/`、"Deposited on: 27 April 2020",以及封面图 `![image](../images/…_sub0.jpg)`(该图是仓库封面,不是论文插图)。
- 处置选项:整体删除封面区;封面图一并删或移入元数据。对 RAG 是纯噪声。
**H3【可能】图片相对路径依赖**
- 全部图片用 `../images/` 相对路径(dmp 第 111 行、ejhf 封面、sim 第 229/231 行、springer 第 65/115/117/119 行)。md 文件一旦脱离原目录结构,图片全部失效。
- 处置选项:a) 保持现状(目录结构不变时无碍);b) 清洗时把路径改写为部署目标路径;c) 校验引用的图片文件是否存在并报告断链。sim 的 Figure 1 实为左右两个面板(sub0/sub1 两张图)共享一条图注(第 233 行),springer 的 Fig. 2 为三面板(sub1–sub3)——合并还是保持多图由师姐定。
## 5. 不建议清洗的内容(保真边界)
- **原文自身的写作瑕疵**:springer 论文语言明显不通("was went to describe"、"In the other hand"、"section 4 discuss"),这是作者问题不是转换噪声,清洗工具不得改写学术内容。
- **欧式千分位**springer "61.532"):疑似原文排版,自动统一有改数风险。
- **专名与缩写的大小写、期刊缩写风格**:不属于转换噪声。
- **A 类内容缺失**:不要试图用生成或推测内容"补全"缺失章节——宁可留空标记。
## 6. 决策清单(供师姐勾选力度)
| 编号 | 问题 | 涉及文件 | 建议决策点 |
|---|---|---|---|
| A1/A2/A4 | 截断与表格缺失 | ejhf, sim, jama | 重新转换 / 接受并标记 / 人工补录 |
| A3 | 图转表格 | dmp | 保留 / 重转 / 换图 |
| B1 | 行号剥离 | jama | 剥离 / 退回要定稿 |
| B2 | 批注删除 | jama | 删(基本无争议) |
| B3 | 修订词对 | jama | 人工定稿对照(不宜自动) |
| B4/B5 | 占位符/坏日期 | jama | 保留标记 / 人工修 |
| C1 | 层级重建 | dmp, ejhf | 推断层级 / 保持平级 |
| C2 | 标题合并 | jama, sim | 合并(低风险) |
| C3/C4 | 乱码标题/页眉 | dmp | 人工改 / 删 |
| D1 | 表格展开 | 全部 | GFM / 缩进 HTML / 不动 |
| D2 | 实体还原 | dmp, ejhf | 还原(低风险) |
| D3/D4/D5 | 表格结构修复 | dmp, springer | 人工修 / 标记低可信 |
| E1 | 乱码专名 | dmp | 人工替换 |
| E2 | 断词拼接 | dmp, sim | 保守合并+白名单 |
| E3 | 段内合并 | jama, ejhf, springer | 启用(对 RAG 影响大) |
| E4 | 段落归位 | springer | 人工 |
| F1 | 编号并入 | sim, springer | 对照处理 |
| F2 | 公式纠错 | sim | 人工(含义级) |
| F3/F4 | 公式空格 | sim, springer | 保守规范化 |
| G1 | 上标统一 | jama, ejhf, springer | 定一种风格 |
| G2 | 数字格式 | ejhf, dmp | 统一 / 保留原文 |
| G3 | 参考文献分隔 | dmp, springer | 统一空行 |
| H1 | arXiv 戳 | sim, springer | 删+接段(勿伤引文) |
| H2 | 封面页 | ejhf | 删 |
| H3 | 图片路径 | 全部 | 现状 / 改写 / 断链校验 |
## 7. 与既有审计的关系
`research-wiki/reference/GOVDOC_SAAS_CLEANING_SCOPE.md`(45 份政务文档审计,原名 MARKDOWN_CLEANING_AUDIT.md)中的幻觉、重复、页眉页脚等类别在本批论文中部分复现(C4/D2/H1 对应旧审计的 D001/L001 类),但本批新增了论文特有的类别:修订稿痕迹(B 类)、公式问题(F 类)、引用上标混用(G1)、截断缺失(A 类)。若后续建立通用清洗规则库,B/F/G 类需要论文 profile,不宜进默认规则。