精简 GovDoc 审计范围:移除敏感信息章节与占位 .gitkeep

- 删除 GOVDOC_SAAS_CLEANING_SCOPE.md 的 4.11 S001(敏感信息)整节,
  及结论摘要中对应的第 7 条合规风险要点;
- reference/ 与 scratch/ 已有实际内容,移除占位 .gitkeep。
This commit is contained in:
2026-08-21 17:47:34 +08:00
parent 977bfb832b
commit 951fba150b
3 changed files with 0 additions and 120 deletions
@@ -16,7 +16,6 @@
4. **重复和超长噪声**:出现 261,838 字符的单行点线、数万字符的重复英语句子、LaTeX 箭头/颜色命令和重复汉字。001 两份文件的非空行重复比例分别达到 81.8% 和 84.1%。
5. **结构扁平化**:全库 29,358 个 Markdown 标题中有 28,736 个是一级标题,占 97.9%;至少 378 个标题缺少空格、只有 `#` 或存在其他明显语法问题。
6. **字符与格式污染**:有 10 个替换字符 ``、20 个私用区字符、11 个 NBSP、5 个零宽字符、1,474 个多余的 `\-` 转义,以及 151,616 行尾部双空格。
7. **真实数据合规风险**:README 明确说明数据来自已上线旧项目中的律所真实上传文件。粗略正则扫描得到身份证号候选 1,976 处、手机号候选 477 处、邮箱 103 处、统一社会信用代码候选 3,259 处。这些数字是候选匹配,不等于已校验的唯一实体数,但足以说明必须把脱敏策略纳入项目设计。
最重要的实施建议是:**不要只产出一份“清洗 Markdown”**。应同时产出:
@@ -275,122 +274,3 @@
- `` 必须逐处回源,无法回源时产生显式未解决项。
- LaTeX 只有在源文件确实包含公式/符号时保留;重复生成的视觉符号应由原图或文本含义替代。
### 4.11 S001:真实个人和企业敏感信息
优先级:如果测试数据会离开受控环境,则为 P0;仅限封闭授权环境时也必须有访问控制。
候选扫描结果:
| 类型 | 候选次数 | 涉及文件数 |
|---|---:|---:|
| 身份证号 | 1,976 | 37 |
| 手机号 | 477 | 41 |
| 邮箱 | 103 | 33 |
| 统一社会信用代码 | 3,259 | 43 |
| “身份证号/联系电话/银行账号/法定代表人”等敏感字段标签 | 2,276 | 44 |
建议提供独立的 `privacy_profile`,而不是把脱敏与文本纠错写死在一起:
- `closed_authorized`:保留原值,仅限受控测试;日志不得打印原始敏感值。
- `masked_compare`:使用确定性、按实体区分的伪名,例如不同手机号映射成不同的 `<PHONE_0001>``<PHONE_0002>`;相同原值是否跨文档保持相同 token,由对比目标决定。
- `public_sample`:除文本脱敏外,还要处理身份证图片、签名、印章、照片、二维码和图片元数据。
不要把所有值都替换成同一个通用 token,否则会造成大规模假相似。
## 5. 分用例处置建议
### 5.1 001-2:建筑工程投标文件
主要问题:
- 两份文档共有 2,596 个 HTML 表格,table 层级分别缺少约 191 和 201 个闭合标签。
- 非空行重复率超过 80%,大量综合单价分析表说明重复。
- 109 个图片引用都是 `page+bbox`,没有图片资产。
- 标题几乎全部为 H1,另有大量居中 `<div>`
建议:两份原始 PDF 都在 `source/`,应优先重新执行带页码、坐标和图片导出的版面解析。001 不适合靠修补现有 HTML 完成最终清洗。现有 Markdown可保留为“旧解析器回归样本”。
### 5.2 002-2121 份江门市中心医院投标文件
这是内容污染最集中的用例。21 份中 19 份命中明确幻觉模板,保守特征合计 1,530 次;全部含失效图片和 HTML 表格。
重点文件:
| fileIndex | 重点问题 | 建议 |
|---:|---|---|
| 0 | 28 次保守幻觉特征;多处 quick/equation150 个 HTML 表格 | 回源重提取污染页 |
| 1 | 12 次特征;重复率 22.5%;表格长行 | 回源并做重复块检查 |
| 2 | 5 次特征;含 ``;表格长行 | `` 逐处回源 |
| 3 | 454 次特征;quick 约 428 次;重复率 44.8%;乱码高频;GFM 表格不一致;含 `` | 灾难性污染,整文档重新提取 |
| 4 | 少量明确幻觉;表格长行 | 按命中页重提取 |
| 5 | 475 次特征;`The steps are:` 约 818 次;含 U+F0D8 | 灾难性污染,整文档重新提取 |
| 6 | 13 次特征 | 按命中页重提取 |
| 7 | 12 次特征;584 行 GFM 表格列数不一致;重复率 25.4% | 表格回源重建,核查文本污染 |
| 8 | 19 次特征;28,624 字符英语重复行 | 至少该页重提取,建议整文档重跑 |
| 9 | 9 次特征 | 按命中页重提取 |
| 10 | 11 次特征;HTML 表格层级也有缺口 | 回源重提取污染页并修表 |
| 11 | 9 次特征 | 按命中页重提取 |
| 12 | 20 次特征;10,937 字符 `The image contains...` 行 | 回源重提取污染页 |
| 13 | 16 次特征 | 按命中页重提取 |
| 14 | 422 次特征;单行 quick 重复约 411 次;还有中文短语退化重复 | 灾难性污染,整文档重新提取 |
| 15 | `Agree to be` 约 813 次;超长 `\textcolor` 行;重复率 20.4% | 灾难性污染,整文档重新提取 |
| 16 | 少量幻觉;内容像单独卷册;重复率 26.3% | 保留卷册边界,按页核查 |
| 17 | 7 次特征;含 ``;可能为分册 | 回源并保留边界 |
| 18 | 未命中当前固定模板,但仍有缺图、H1 扁平和 HTML 表格 | 不能视为干净;做结构清洗和抽检 |
| 19 | 未命中当前固定模板,但仍有 53 个缺失图片及表格 | 做结构清洗和抽检 |
| 20 | 少量特征;目录条目成百次重复 | 识别目录/正文边界并去版式重复 |
本用例没有保存原始 PDF,只有 Markdown 和 reviewed DOCX。清洗项目开始前应确认能否从旧存储追回原上传文件;如果不能,不能宣称已完成内容级无损修复。
### 5.3 003-1010 份物业投标文件
该用例有原始 PDF,可建立最可靠的回源修复和质量评测。
| fileIndex | 重点问题 | 建议 |
|---:|---|---|
| 0 | 缺图、H1 扁平、HTML 表格 | 结构清洗,按页抽检 |
| 1 | 至少 1 次明确模板污染;缺图和表格 | 命中页重提取 |
| 2 | 开头即乱码/幻觉;63 次保守特征;261,838 字符点线;19,089 字符箭头行 | 最高优先级,整份从 PDF 重提取 |
| 3 | 37 次特征;505 个缺图;HTML 表格 | 整份重提取或至少覆盖全部命中页 |
| 4 | 模板污染;含 ``;表格长行 | 回源修复字符和污染页 |
| 5 | 5 次特征;含 `` | 回源修复 |
| 6 | 未命中固定模板,但有缺图和表格 | 结构清洗,抽检 |
| 7 | 29 次特征;重复 `\textcolor`3 个 U+F0D8;392 个缺图 | 整份重提取优先 |
| 8 | 少量模板污染;运行标题重复明显 | 修污染页,移除对比版页眉 |
| 9 | 4 个 ``;超长/重复汉字;大表格 | 回源重提取异常页并修表 |
### 5.4 004-2:采购文件
- `file_0`:图片缺失、H1 断裂、HTML 表格;第 613 行表头语义明显异常。
- `file_1`:7 次保守幻觉特征、重复率 27.0%、34 个缺图,并有长重复汉字。
该目录没有原始 PDF。应优先追回源文件;reviewed DOCX 只能在确认其来源和人工修改范围后作为替代依据。
### 5.5 005-3:响应文件
- 三份文档都命中少量明确幻觉特征,分别约 3、1、3 次。
- 非空行重复率约 30.4%、20.9%、31.9%。重复中既可能有劳动合同模板等真实内容,也可能有转换器重复,必须区分。
- `file_2```,且有 11,599 字符的单行 HTML 表格。
- 三份共有 359 个失效图片和 476 个 HTML 表格。
建议先按异常页回源;若源文件不可得,则至少将不确定片段隔离并生成未解决清单。
### 5.6 006-3:含 OCR 的投标文件
- README 标注 `file_1``file_2` 为 OCR 版;三份文档段落规模差异很大。
- `file_0` 命中 21 次保守幻觉特征,说明非 README 标注的 OCR 文件也不能默认安全。
- `file_2` 命中 1 次明确特征;`file_1` 未命中当前固定模板,但仍有缺图和结构问题。
- 三份共有 162 个失效图片、130 个 HTML 表格。
建议把 006 作为 OCR A/B 测试集:逐页记录“文本层提取、传统 OCR、视觉模型”三个结果的字符错误率、结构恢复率和幻觉率,不应只比较最终段落数。
### 5.7 007-4:纯文字投标文件
README 称其为“纯文字(无表格)”,但 Markdown 实际有 2,792 个 GFM 表格行,说明转换器很可能用表格表达页面布局,而非文档真的包含大量语义表格。
- `file_0`1,159 个空 Base64 图片占位;21 个行列不一致表格块;8 个 U+F0B7。
- `file_1`:1,113 个空占位;20 个不一致表格块;171 个悬空 Word TOC 链接。
- `file_2`:1,048 个空占位;7 个不一致表格块;U+F070 7 个、U+F0D8 1 个。
- `file_3`:692 个空占位;12 个不一致表格块;2 个表格块缺分隔行;4 个空/异常标题。
这四份文档即使文本看起来较整齐,也因图片数据已丢失而不能算完整。应从原上传文件重新导出图片和表格;没有源文件时只能产出明确标注“不完整”的文本版。