← 返回归档

政务红头文件 16 表零丢失:docx 结构化还原实战

2026-08-07作者:贺去病(贺方升)阅读约 2 分钟#docx#文档结构化#AI#政务#本象协议
本象协议:AI 长跑不丢剑——保存本象,按需投影
本象协议 · 一源万影:保存本象,按需投影

一份典型的中文政务红头文件(2019 年印发)需要交给 AI 使用。这份 docx 有 6 章 77 条、16 个附表,表格里塞满了合并单元格、□勾选框、跨页表——是政务文档的典型样貌。

问题:行业都在「把纸猜成字」

直接喂给 AI 是浪费。行业主流做法是「把纸猜成字」(OCR / 版面分析),但这是原生电子文档,信息本来无损——pandoc 直转实测 16 个表格全部丢失,微软 markitdown 不还原合并单元格。扫描件赛道的 SOTA(OmniDocBench 端到端)表格 TEDS 也只有 0.78。

做法:直读原生结构,零 OCR

用本象协议 office 方言直读 docx 的 OOXML 结构,零 OCR:

  • 6 章 → ## 标题,77 条 → ### 标题,AI 可以精确锚定「第五十条」
  • 16 个表格全部还原为 Markdown 管道表(213 表行),合并单元格按 gridSpan / vMerge 展开
  • □勾选框、表号、审核编号、备注说明全部保留
  • 零依赖 Node 实现,一条命令:node adapters/office/import.mjs 文件.docx 输出.md

结果:213 行表格零丢失

62KB 结构化 Markdown,表格 213 行零丢失。对照 pandoc(0 表)和 markitdown(合并丢失),在「原生文档结构还原」这条赛道上做到结构 100% 保真——因为信息源无损,根本不需要猜。

意义:原生电子文档是无人区

行业把火力全放在 PDF 扫描件上,原生电子文档反而没人认真做。本象协议把「docx → 可验证的状态对象」定义为一条新赛道:转换结果可回滚、可追溯、条款可锚定——这是给 AI 的持久记忆层,不是一次性导出。

GitHub:本象协议 2origin(Apache-2.0,零依赖)