From 951fba150be0294164a1fcb51498d98964fd3f5e Mon Sep 17 00:00:00 2001 From: Bepr4 <63661977@qq.com> Date: Fri, 21 Aug 2026 17:47:34 +0800 Subject: [PATCH] =?UTF-8?q?=E7=B2=BE=E7=AE=80=20GovDoc=20=E5=AE=A1?= =?UTF-8?q?=E8=AE=A1=E8=8C=83=E5=9B=B4=EF=BC=9A=E7=A7=BB=E9=99=A4=E6=95=8F?= =?UTF-8?q?=E6=84=9F=E4=BF=A1=E6=81=AF=E7=AB=A0=E8=8A=82=E4=B8=8E=E5=8D=A0?= =?UTF-8?q?=E4=BD=8D=20.gitkeep?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit - 删除 GOVDOC_SAAS_CLEANING_SCOPE.md 的 4.11 S001(敏感信息)整节, 及结论摘要中对应的第 7 条合规风险要点; - reference/ 与 scratch/ 已有实际内容,移除占位 .gitkeep。 --- research-wiki/reference/.gitkeep | 0 .../reference/GOVDOC_SAAS_CLEANING_SCOPE.md | 120 ------------------ research-wiki/scratch/.gitkeep | 0 3 files changed, 120 deletions(-) delete mode 100644 research-wiki/reference/.gitkeep delete mode 100644 research-wiki/scratch/.gitkeep diff --git a/research-wiki/reference/.gitkeep b/research-wiki/reference/.gitkeep deleted file mode 100644 index e69de29..0000000 diff --git a/research-wiki/reference/GOVDOC_SAAS_CLEANING_SCOPE.md b/research-wiki/reference/GOVDOC_SAAS_CLEANING_SCOPE.md index 3bc0359..9ba4a06 100644 --- a/research-wiki/reference/GOVDOC_SAAS_CLEANING_SCOPE.md +++ b/research-wiki/reference/GOVDOC_SAAS_CLEANING_SCOPE.md @@ -16,7 +16,6 @@ 4. **重复和超长噪声**:出现 261,838 字符的单行点线、数万字符的重复英语句子、LaTeX 箭头/颜色命令和重复汉字。001 两份文件的非空行重复比例分别达到 81.8% 和 84.1%。 5. **结构扁平化**:全库 29,358 个 Markdown 标题中有 28,736 个是一级标题,占 97.9%;至少 378 个标题缺少空格、只有 `#` 或存在其他明显语法问题。 6. **字符与格式污染**:有 10 个替换字符 `�`、20 个私用区字符、11 个 NBSP、5 个零宽字符、1,474 个多余的 `\-` 转义,以及 151,616 行尾部双空格。 -7. **真实数据合规风险**:README 明确说明数据来自已上线旧项目中的律所真实上传文件。粗略正则扫描得到身份证号候选 1,976 处、手机号候选 477 处、邮箱 103 处、统一社会信用代码候选 3,259 处。这些数字是候选匹配,不等于已校验的唯一实体数,但足以说明必须把脱敏策略纳入项目设计。 最重要的实施建议是:**不要只产出一份“清洗 Markdown”**。应同时产出: @@ -275,122 +274,3 @@ - `�` 必须逐处回源,无法回源时产生显式未解决项。 - LaTeX 只有在源文件确实包含公式/符号时保留;重复生成的视觉符号应由原图或文本含义替代。 -### 4.11 S001:真实个人和企业敏感信息 - -优先级:如果测试数据会离开受控环境,则为 P0;仅限封闭授权环境时也必须有访问控制。 - -候选扫描结果: - -| 类型 | 候选次数 | 涉及文件数 | -|---|---:|---:| -| 身份证号 | 1,976 | 37 | -| 手机号 | 477 | 41 | -| 邮箱 | 103 | 33 | -| 统一社会信用代码 | 3,259 | 43 | -| “身份证号/联系电话/银行账号/法定代表人”等敏感字段标签 | 2,276 | 44 | - -建议提供独立的 `privacy_profile`,而不是把脱敏与文本纠错写死在一起: - -- `closed_authorized`:保留原值,仅限受控测试;日志不得打印原始敏感值。 -- `masked_compare`:使用确定性、按实体区分的伪名,例如不同手机号映射成不同的 ``、``;相同原值是否跨文档保持相同 token,由对比目标决定。 -- `public_sample`:除文本脱敏外,还要处理身份证图片、签名、印章、照片、二维码和图片元数据。 - -不要把所有值都替换成同一个通用 token,否则会造成大规模假相似。 - -## 5. 分用例处置建议 - -### 5.1 001-2:建筑工程投标文件 - -主要问题: - -- 两份文档共有 2,596 个 HTML 表格,table 层级分别缺少约 191 和 201 个闭合标签。 -- 非空行重复率超过 80%,大量综合单价分析表说明重复。 -- 109 个图片引用都是 `page+bbox`,没有图片资产。 -- 标题几乎全部为 H1,另有大量居中 `
`。 - -建议:两份原始 PDF 都在 `source/`,应优先重新执行带页码、坐标和图片导出的版面解析。001 不适合靠修补现有 HTML 完成最终清洗。现有 Markdown可保留为“旧解析器回归样本”。 - -### 5.2 002-21:21 份江门市中心医院投标文件 - -这是内容污染最集中的用例。21 份中 19 份命中明确幻觉模板,保守特征合计 1,530 次;全部含失效图片和 HTML 表格。 - -重点文件: - -| fileIndex | 重点问题 | 建议 | -|---:|---|---| -| 0 | 28 次保守幻觉特征;多处 quick/equation;150 个 HTML 表格 | 回源重提取污染页 | -| 1 | 12 次特征;重复率 22.5%;表格长行 | 回源并做重复块检查 | -| 2 | 5 次特征;含 `�`;表格长行 | `�` 逐处回源 | -| 3 | 454 次特征;quick 约 428 次;重复率 44.8%;乱码高频;GFM 表格不一致;含 `�` | 灾难性污染,整文档重新提取 | -| 4 | 少量明确幻觉;表格长行 | 按命中页重提取 | -| 5 | 475 次特征;`The steps are:` 约 818 次;含 U+F0D8 | 灾难性污染,整文档重新提取 | -| 6 | 13 次特征 | 按命中页重提取 | -| 7 | 12 次特征;584 行 GFM 表格列数不一致;重复率 25.4% | 表格回源重建,核查文本污染 | -| 8 | 19 次特征;28,624 字符英语重复行 | 至少该页重提取,建议整文档重跑 | -| 9 | 9 次特征 | 按命中页重提取 | -| 10 | 11 次特征;HTML 表格层级也有缺口 | 回源重提取污染页并修表 | -| 11 | 9 次特征 | 按命中页重提取 | -| 12 | 20 次特征;10,937 字符 `The image contains...` 行 | 回源重提取污染页 | -| 13 | 16 次特征 | 按命中页重提取 | -| 14 | 422 次特征;单行 quick 重复约 411 次;还有中文短语退化重复 | 灾难性污染,整文档重新提取 | -| 15 | `Agree to be` 约 813 次;超长 `\textcolor` 行;重复率 20.4% | 灾难性污染,整文档重新提取 | -| 16 | 少量幻觉;内容像单独卷册;重复率 26.3% | 保留卷册边界,按页核查 | -| 17 | 7 次特征;含 `�`;可能为分册 | 回源并保留边界 | -| 18 | 未命中当前固定模板,但仍有缺图、H1 扁平和 HTML 表格 | 不能视为干净;做结构清洗和抽检 | -| 19 | 未命中当前固定模板,但仍有 53 个缺失图片及表格 | 做结构清洗和抽检 | -| 20 | 少量特征;目录条目成百次重复 | 识别目录/正文边界并去版式重复 | - -本用例没有保存原始 PDF,只有 Markdown 和 reviewed DOCX。清洗项目开始前应确认能否从旧存储追回原上传文件;如果不能,不能宣称已完成内容级无损修复。 - -### 5.3 003-10:10 份物业投标文件 - -该用例有原始 PDF,可建立最可靠的回源修复和质量评测。 - -| fileIndex | 重点问题 | 建议 | -|---:|---|---| -| 0 | 缺图、H1 扁平、HTML 表格 | 结构清洗,按页抽检 | -| 1 | 至少 1 次明确模板污染;缺图和表格 | 命中页重提取 | -| 2 | 开头即乱码/幻觉;63 次保守特征;261,838 字符点线;19,089 字符箭头行 | 最高优先级,整份从 PDF 重提取 | -| 3 | 37 次特征;505 个缺图;HTML 表格 | 整份重提取或至少覆盖全部命中页 | -| 4 | 模板污染;含 `�`;表格长行 | 回源修复字符和污染页 | -| 5 | 5 次特征;含 `�` | 回源修复 | -| 6 | 未命中固定模板,但有缺图和表格 | 结构清洗,抽检 | -| 7 | 29 次特征;重复 `\textcolor`;3 个 U+F0D8;392 个缺图 | 整份重提取优先 | -| 8 | 少量模板污染;运行标题重复明显 | 修污染页,移除对比版页眉 | -| 9 | 4 个 `�`;超长/重复汉字;大表格 | 回源重提取异常页并修表 | - -### 5.4 004-2:采购文件 - -- `file_0`:图片缺失、H1 断裂、HTML 表格;第 613 行表头语义明显异常。 -- `file_1`:7 次保守幻觉特征、重复率 27.0%、34 个缺图,并有长重复汉字。 - -该目录没有原始 PDF。应优先追回源文件;reviewed DOCX 只能在确认其来源和人工修改范围后作为替代依据。 - -### 5.5 005-3:响应文件 - -- 三份文档都命中少量明确幻觉特征,分别约 3、1、3 次。 -- 非空行重复率约 30.4%、20.9%、31.9%。重复中既可能有劳动合同模板等真实内容,也可能有转换器重复,必须区分。 -- `file_2` 含 `�`,且有 11,599 字符的单行 HTML 表格。 -- 三份共有 359 个失效图片和 476 个 HTML 表格。 - -建议先按异常页回源;若源文件不可得,则至少将不确定片段隔离并生成未解决清单。 - -### 5.6 006-3:含 OCR 的投标文件 - -- README 标注 `file_1`、`file_2` 为 OCR 版;三份文档段落规模差异很大。 -- `file_0` 命中 21 次保守幻觉特征,说明非 README 标注的 OCR 文件也不能默认安全。 -- `file_2` 命中 1 次明确特征;`file_1` 未命中当前固定模板,但仍有缺图和结构问题。 -- 三份共有 162 个失效图片、130 个 HTML 表格。 - -建议把 006 作为 OCR A/B 测试集:逐页记录“文本层提取、传统 OCR、视觉模型”三个结果的字符错误率、结构恢复率和幻觉率,不应只比较最终段落数。 - -### 5.7 007-4:纯文字投标文件 - -README 称其为“纯文字(无表格)”,但 Markdown 实际有 2,792 个 GFM 表格行,说明转换器很可能用表格表达页面布局,而非文档真的包含大量语义表格。 - -- `file_0`:1,159 个空 Base64 图片占位;21 个行列不一致表格块;8 个 U+F0B7。 -- `file_1`:1,113 个空占位;20 个不一致表格块;171 个悬空 Word TOC 链接。 -- `file_2`:1,048 个空占位;7 个不一致表格块;U+F070 7 个、U+F0D8 1 个。 -- `file_3`:692 个空占位;12 个不一致表格块;2 个表格块缺分隔行;4 个空/异常标题。 - -这四份文档即使文本看起来较整齐,也因图片数据已丢失而不能算完整。应从原上传文件重新导出图片和表格;没有源文件时只能产出明确标注“不完整”的文本版。 diff --git a/research-wiki/scratch/.gitkeep b/research-wiki/scratch/.gitkeep deleted file mode 100644 index e69de29..0000000