建立实验室共用库定位并完成论文/GovDoc 两批数据的问题审计

- README 更新项目定位为实验室共用清洗库,明确 data/ 职责与 profile 复用原则;
- 新增 ClinDB-ReviewBench(论文清洗)5 份 Markdown 问题审计(scratch),
  并确定第一版清洗范围:9 类确定性规则(reference/CLINDB_REVIEWBENCH_CLEANING_SCOPE.md);
- 45 份政务文档审计重命名为 GOVDOC_SAAS_CLEANING_SCOPE.md,截去第 6 节起的
  实施建议,只保留问题报告(396 行);
- 收录 2026-08-20 生态调研草稿(scratch)。
This commit is contained in:
2026-08-21 17:44:23 +08:00
parent be1a600fdc
commit 977bfb832b
5 changed files with 1240 additions and 10 deletions
@@ -0,0 +1,225 @@
# data/ 五份论文 Markdown 审计报告(2026-08-21
> 状态:scratch 草稿,供评审。清洗力度由师姐逐项决定,本报告只列问题、证据和可选处置,不做力度决策。
## 1. 结论摘要
- 五份文件均为英文学术论文的 PDF→Markdown 转换产物,分属 5 个来源(JAMA、EJHF、Statistics in Medicine/arXiv、Springer/arXiv、Disaster Med Public Health Preparedness),噪声特征差异很大,不能用一套固定规则覆盖。
- 最严重的问题不是格式噪声,而是**内容丢失**:2 份文件中途截断,1 份(JAMA)所有表格整体缺失。这类问题清洗无法恢复,只能重新转换或人工补录。
- JAMA 文件的原始 PDF 是**未定稿的 Word 修订稿**,行号、审阅批注、修订残留词对全部泄漏进正文,是五份中污染最重的。
- 格式类噪声(双重转义实体 31 处、孤行公式编号 12 处、空行断句、标题层级扁平、引用上标混用等)确定可清洗,风险低。
- 少数问题涉及**语义改变**(数学公式被 OCR 改错、乱码替换专名),自动清洗有改错正文的风险,建议人工确认。
## 2. 审计范围与方法
- 对象:`data/*/markdowns/*.md` 共 5 份,逐行人工通读;行号均指 markdowns 下的 md 文件。
- 辅助统计(本轮实际执行):标题层级计数、图片/表格/实体/批注/arXiv 戳的 grep 计数。
- 判定原则:只把"转换管线引入的噪声"列为清洗对象;原文自身的写作瑕疵(如语法错误)不属于转换噪声,单独列出并标注"不建议清洗"。
- 未验证项:未与原 PDF 逐页比对内容完整性,"缺失"结论基于文内自引用(如正文提到 Table 2 但全文无 Table 2)和文件截断位置。
## 3. 总体统计
| 文件(下文简称) | 行数 | H1 | H2 | H3+ | 图片 | HTML表格 | 双重转义 | 孤行编号 | 批注 | arXiv边栏戳 |
|---|---|---|---|---|---|---|---|---|---|---|
| dmp (Disaster Med) | 208 | 0 | 11 | 0 | 1 | 7 | 23 | 0 | 0 | 0 |
| jama (JAMA 2024) | 349 | 2 | 10 | 0 | 0 | 0 | 0 | 0 | 2 | 0 |
| ejhf (EJHF 2020) | 143 | 1 | 13 | 0 | 1 | 1 | 8 | 0 | 0 | 0 |
| sim (Stat Med/arXiv) | 247 | 2 | 11 | 0 | 2 | 0 | 0 | 12 | 0 | 1 |
| springer (ICU LSTM) | 154 | 1 | 12 | 0 | 4 | 1 | 0 | 1 | 0 | 1 |
补充:jama 有 128 行以"行号+空格"开头(手稿行号泄漏);springer 的 3 处 arXiv 字符串中 2 处是参考文献的正常引用,仅 1 处是边栏戳。
## 4. 问题清单
每项标注:【确定】= 确定是转换噪声,可安全清洗;【语义】= 涉及内容判断,建议人工确认;【丢失】= 内容缺失,清洗不可恢复。处置选项仅供师姐选择。
### A. 内容级问题(最严重)
**A1【丢失】两份文件中途截断**
- ejhf 第 143 行在 Table 1 HTML 表格中间戛然而止("Medical history at randomization, no. (%)" 行后为空单元格)。Table 1 后半、Tables 2–4、全部图注、参考文献整体缺失。
- sim 第 247 行止于方法 M5 描述中间,且结尾 URL 损坏(`https://cran.r-project.org/web/p6$^{10}$`)。第 3 节(结果)、4、5 节、参考文献、附录缺失。
- 处置选项:a) 退回重新转换;b) 接受现状并在元数据标记"截断";c) 人工补录缺失部分。清洗管线本身无法解决。
**A2【丢失】jama 全部表格缺失**
- 正文多处引用 Table、Box 1、eTables 13,但全文 0 个表格、0 张图片。摘要性内容(如各器官系统阈值表)完全丢失。
- 处置选项:同 A1。
**A3【丢失】dmp 的 FIGURE 1 流程图被转成 HTML 表格**
- 第 83 行:流程图(决策树)被输出为单行 HTML 表格,图形语义尽失,仅 FIGURE 2(第 111 行)保留为图片。
- 处置选项:a) 保留现状(有总比没有好);b) 重新转换该页;c) 人工用图片替换。
**A4【丢失】sim 第 93 行句子开头缺失**
- "/unpenalized) regression models" 以斜杠开头,前文整句丢失。
- 处置选项:标记为损坏片段,或对照原文补录。
### B. 草稿/修订痕迹泄漏(仅 jama,原稿是 Word 修订稿)
**B1【确定】手稿行号泄漏(128 行)**
- 正文行以行号开头:"25 increase in the Sequential..."(第 115 行)、"26 with suspected infection"(第 116 行)等;标题也带行号:"## 116 Results/recommandations"(第 149 行)、"## 117 Criteria..."(第 151 行)、"## 143 Organ dysfunction..."(第 165 行)。
- 处置选项:a) 剥离行首行号(注意与正常编号列表、年份区分);b) 连同批注一起整体退回,要求提供定稿版。
**B2【确定】审阅批注泄漏(2 处)**
- 第 155157 行:"Commented [LS1]: Why highlighted?"、"Commented [SW2R1]: To make sure we use capital letters..."。
- 处置选项:整段删除。注意第 292 行还有一句删除文字与保留文字混杂的句子("Appropriate process and balancing measures Efforts to enhance..."),需人工断句。
**B3【语义】Word 修订残留词对(约 7 处)**
- "defined identified by as"(第 91 行)、"defined identified using by"(第 153 行)、"defined identified as in sepsis-septic patients"(第 116 行)、"defined indicate by as"(第 163 行)、"was were derived"(第 306 行)、"The new-Phoenix"(第 197 行)等——是"插入词+删除词"并存的痕迹。
- 哪个词是最终保留词需要对照定稿判断,自动二选一有风险。处置选项:a) 人工逐处确认;b) 退回要定稿。
**B4【确定】未填占位符**
- "XX societies"(第 101 行)、"XX-microbiological testing and YY-antibiotics"(第 302 行)、"Endorsing societies: To be populated after acceptance"(第 317 行)。
- 处置选项:保留并标记待补,或等定稿填充后再清洗。
**B5【确定】日期损坏**
- 第 85 行 "Revision date: December 3122, 2023"。
- 处置选项:对照原文改为 2023 年内正确日期(人工)。
### C. 标题结构问题
**C1【确定】标题层级扁平**
- dmp0 个 H111 个 H2 全部同级(含 Introduction/Methods/Results 等,第 1,3,7,59,67,103,137,153 行)。
- ejhf:主章节与子章节同为 H2"## Methods" 第 51 行、"## Study population" 第 53 行),无层级区分。
- 处置选项:按章节编号/语义推断层级(2.1 → H3),或统一降级保持平级。前者需人工核对推断结果。
**C2【确定】标题被拆分成两行**
- jama:标题拆成两个 H1(第 12 行 "International Consensus Criteria..." / "The Phoenix Pediatric Sepsis Criteria",实为正副标题)。
- sim:主标题拆成两个 H1(第 34 行 "Conounder selection..." / "treatment effect estimators",且首词 "Conounder" 是 OCR 错字,原文应为 Confounder);2.2 节标题拆两行(第 183/185 行 "…full matching on the propensity" / "## score")。
- 处置选项:合并为单标题;sim 主标题的 "Conounder" 拼写需对照原文确认(【语义】)。
**C3【语义】乱码标题**
- dmp 第 47 行 `## ่วง`(泰文字符)。按位置推断应为 METHODS,但不能凭推断改写正文级内容。
- 处置选项:人工对照 PDF 改回,或删除该标题。
**C4【确定】跑动页眉混入正文且被标为标题**
- dmp 第 73、191 行 "## MSOFA Score for Critical Care Triage" 出现在句中和 REFERENCES 内;第 71→75 行一句话被它从中间切断。
- 处置选项:删除页眉行并把被切断的句子接回。
### D. 表格问题
**D1【确定】表格压缩为单行 HTML**
- 全部 9 个表格(dmp 7、ejhf 1、springer 1)都是 `<table>...</table>` 单行输出,diff、review、编辑都极难。
- 处置选项:转 GFM 多行表格(简单表);对含 rowspan/colspan 的复杂表保留 HTML 但格式化缩进。
**D2【确定】HTML 实体双重转义(31 处)**
- dmp 23 处(`&amp;gt;400``&amp;lt;1.2``MAP&amp;lt;70`,第 27/33/39 行等);ejhf 8 处(`A1C&amp;lt;7``7≤A1C&amp;lt;8`,第 143 行)。
- 处置选项:还原一层转义(`&amp;gt;``>`)。这是最安全的清洗之一。
**D3【确定】合并单元格信息丢失**
- dmp 第 33 行 Table 2 的 Liver 行出现空 `<td></td>`,跨行合并关系丢失,数值与表头对应断裂。
- 处置选项:对照 PDF 人工修复合并结构,或标记为低可信表格。
**D4【确定】表格行错误合并**
- dmp 第 39 行 Table 3:四个器官系统 "Respiratory Coagulation Liver Cardiovascular" 被挤进一个单元格。
- 处置选项:人工拆分修复。
**D5【确定】表头 OCR 乱码**
- springer 第 111 行 Table 1 表头 "Claesther"(应为 Classifier)。
- 处置选项:人工改正(单处,低成本)。
### E. 文本级损坏
**E1【语义】跨脚本字符替换**
- dmp 第 43 行 "atينS Hospital"、第 55 行 "ينDS Hospital"——阿拉伯字符 ين 替换了 "LD"LDS Hospital 是机构专名)。
- 处置选项:人工替换回 "LDS"。自动规则可检出非拉丁字符混入,但替换动作建议人工确认。
**E2【确定】跨页断词**
- dmp:第 125 行结尾 "…at the relevant thresh" + 第 127 行 "olds of 8 and 11"(单词 thresholds 被页边界切开)。
- sim:第 87/89 行 "except possi-" / "bly via treatment";第 217/219 行 "cre-" / "ated by permuting"。
- 处置选项:拼接断词(去连字符合并)。需注意英语中合法的行尾连字符(如 "well-known")不能误合并,建议只合并"行尾连字符+下一行首为小写字母且拼出的词在词表内"的情况,其余保留待审。
**E3【确定】句内空行断句**
- 大量段落被空行从句子中间切开:jama 第 103→105、113→115 行;ejhf 第 4749、5759、6769、8789、113115、131133 行;springer 第 16→20 行(中间还被 arXiv 戳隔开,见 H1)、42→44 行。
- 处置选项:段内合并(前段末无句号且后段首为小写/连接词时拼接)。这是对 RAG 分块影响最大的问题之一。
**E4【确定】段落内容错位/孤立行**
- springer 第 63 行孤立 "1"(公式编号漂移,见 F1);第 8183 行 "…improve the simple Multilayer Perceptron… other deep models." 后接 "including RNNs and MLPs.",段落被错误切开。
- 处置选项:结合上下文人工归位。
### F. 数学公式问题(sim 最重,springer 次之)
**F1【确定】公式编号漂移成孤行**
- sim 12 处:第 63/70/81/107/117/133/145/153/161/171/179/197 行分别是 "1"、"2"、"(4)"…"(12)"springer 第 63 行 "1"。
- 处置选项:并入对应公式块或删除(若公式本体已带编号)。需逐处对照,不宜盲目删除。
**F2【语义】公式内容被 OCR 改错**
- sim 第 139 行 `$\exp(x) = \exp(x)/\{1+\exp(x)\}$`——这是 expit 函数定义(x↦e^x/(1+e^x)),左边的 $\exp(x)$ 应为 $x$ 或 expit(x)。OCR 错误改变了数学含义,且这种错误会误导下游读者。
- 处置选项:人工对照原文修复;自动工具只能标记"公式与上下文不符",不宜自动改。
- sim 第 119 行 "weights w k" 下标丢失,同类。
**F3【确定】LaTeX 冗余空格与风格不一**
- sim 全文行内公式带前导空格(`$ \widehat{\psi}_{j} $`)、内部空格过多(`\widehat { \mathrm { E } } ( Y ^ { a } )`,第 150 行)。
- 处置选项:规范化空格(不改变符号语义的前提下)。风险低但需保守,避免动 `\,` `\;` 等有意义的间距命令。
**F4【确定】公式 OCR 字符间距拉宽**
- springer 第 72/78 行 cases 环境里 `\mathrm { s u r v i v o r s ~ g r o u p }` 逐字空格。
- 处置选项:去除字母间空格(保守做法:只处理 `\mathrm{}` 内的单字母间距模式)。
### G. 格式不一致
**G1【确定】引用上标风格混用**
- 同一文件内 LaTeX `$^{1,2}$` 与 Unicode 上标(¹²、²⁻⁴、⁴⁹ ⁵⁰,⁵¹)并存:jama(第 115116 行 Unicode vs 第 107/187 行 `$\geq 2$`)、ejhf(第 4549 行 LaTeX vs 第 133 行 Unicode)、springer(第 56 行 `$ ^{1} $` vs 第 20 行 [1,2,4,3] 方括号)。
- 处置选项:统一为一种(选哪种由师姐定,取决于下游用途:RAG 检索倾向 Unicode 纯文本,渲染倾向 LaTeX)。
**G2【可能】数字格式不一致**
- ejhf 第 55/57 行 "6068 patients" vs "4,091 patients"dmp 第 91 行 "0.81-.85"(小数点前缺 0)。
- 注意:springer 的 "61.532"、"46.520" 是欧式千分位,可能是原文排版而非转换噪声,不能自动统一。
- 处置选项:统一千分位与小数风格;欧式写法是否转换需师姐定。
**G3【确定】参考文献列表分隔不一致**
- dmprefs 118 空行分隔,1933 连续堆叠(第 193208 行);springerrefs 18 空行分隔,919 连续堆叠(第 140–154 行)。
- 处置选项:统一为一条一空行。
### H. 非正文噪声与资产
**H1【确定】arXiv 边栏戳**
- sim 第 1 行 "arXiv:2001.08971v3 [stat.ME] 10 Oct 2020"springer 第 18 行同类戳插在 Introduction 段落中间,把一段话切成三截(第 16/18/20 行)。
- 处置选项:删除戳行并接回段落。注意别误删参考文献中的合法 "arXiv preprint arXiv:…"springer 第 143/152 行)。
**H2【确定】机构仓库封面页**
- ejhf 第 111 行:Glasgow eprints 引用说明、版本声明、`http://eprints.gla.ac.uk/213358/`、"Deposited on: 27 April 2020",以及封面图 `![image](../images/…_sub0.jpg)`(该图是仓库封面,不是论文插图)。
- 处置选项:整体删除封面区;封面图一并删或移入元数据。对 RAG 是纯噪声。
**H3【可能】图片相对路径依赖**
- 全部图片用 `../images/` 相对路径(dmp 第 111 行、ejhf 封面、sim 第 229/231 行、springer 第 65/115/117/119 行)。md 文件一旦脱离原目录结构,图片全部失效。
- 处置选项:a) 保持现状(目录结构不变时无碍);b) 清洗时把路径改写为部署目标路径;c) 校验引用的图片文件是否存在并报告断链。sim 的 Figure 1 实为左右两个面板(sub0/sub1 两张图)共享一条图注(第 233 行),springer 的 Fig. 2 为三面板(sub1–sub3)——合并还是保持多图由师姐定。
## 5. 不建议清洗的内容(保真边界)
- **原文自身的写作瑕疵**:springer 论文语言明显不通("was went to describe"、"In the other hand"、"section 4 discuss"),这是作者问题不是转换噪声,清洗工具不得改写学术内容。
- **欧式千分位**springer "61.532"):疑似原文排版,自动统一有改数风险。
- **专名与缩写的大小写、期刊缩写风格**:不属于转换噪声。
- **A 类内容缺失**:不要试图用生成或推测内容"补全"缺失章节——宁可留空标记。
## 6. 决策清单(供师姐勾选力度)
| 编号 | 问题 | 涉及文件 | 建议决策点 |
|---|---|---|---|
| A1/A2/A4 | 截断与表格缺失 | ejhf, sim, jama | 重新转换 / 接受并标记 / 人工补录 |
| A3 | 图转表格 | dmp | 保留 / 重转 / 换图 |
| B1 | 行号剥离 | jama | 剥离 / 退回要定稿 |
| B2 | 批注删除 | jama | 删(基本无争议) |
| B3 | 修订词对 | jama | 人工定稿对照(不宜自动) |
| B4/B5 | 占位符/坏日期 | jama | 保留标记 / 人工修 |
| C1 | 层级重建 | dmp, ejhf | 推断层级 / 保持平级 |
| C2 | 标题合并 | jama, sim | 合并(低风险) |
| C3/C4 | 乱码标题/页眉 | dmp | 人工改 / 删 |
| D1 | 表格展开 | 全部 | GFM / 缩进 HTML / 不动 |
| D2 | 实体还原 | dmp, ejhf | 还原(低风险) |
| D3/D4/D5 | 表格结构修复 | dmp, springer | 人工修 / 标记低可信 |
| E1 | 乱码专名 | dmp | 人工替换 |
| E2 | 断词拼接 | dmp, sim | 保守合并+白名单 |
| E3 | 段内合并 | jama, ejhf, springer | 启用(对 RAG 影响大) |
| E4 | 段落归位 | springer | 人工 |
| F1 | 编号并入 | sim, springer | 对照处理 |
| F2 | 公式纠错 | sim | 人工(含义级) |
| F3/F4 | 公式空格 | sim, springer | 保守规范化 |
| G1 | 上标统一 | jama, ejhf, springer | 定一种风格 |
| G2 | 数字格式 | ejhf, dmp | 统一 / 保留原文 |
| G3 | 参考文献分隔 | dmp, springer | 统一空行 |
| H1 | arXiv 戳 | sim, springer | 删+接段(勿伤引文) |
| H2 | 封面页 | ejhf | 删 |
| H3 | 图片路径 | 全部 | 现状 / 改写 / 断链校验 |
## 7. 与既有审计的关系
`research-wiki/reference/GOVDOC_SAAS_CLEANING_SCOPE.md`(45 份政务文档审计,原名 MARKDOWN_CLEANING_AUDIT.md)中的幻觉、重复、页眉页脚等类别在本批论文中部分复现(C4/D2/H1 对应旧审计的 D001/L001 类),但本批新增了论文特有的类别:修订稿痕迹(B 类)、公式问题(F 类)、引用上标混用(G1)、截断缺失(A 类)。若后续建立通用清洗规则库,B/F/G 类需要论文 profile,不宜进默认规则。