
이슈와 논점 ← 刊物系列名【免费下载链接】doclingGet your documents ready for gen AI项目地址: https://gitcode.com/GitHub_Trending/do/docling코로나-19 관련 보험약관상 재해보험금 지급문제 및 개선과제 ← 主标题들어가며 1 ← 第 1 节标题自带序号 1코로나-19 관련 보험 현황 2 ← 第 2 节문제점 3 ← 第 3 节개선과제 4 ← 第 4 节맺으며 5 ← 第 5 节节内子标题如 (1) 「감염병의 예방 및 관리에 관한 법률」 개정、(2) 생명보험 표준약관 재해분류표、(3) 보험사의 보험금 지급실무상 혼선 초래 等同样以 ## 呈现。可见该版式下 Docling 将一级版面标题统一映射为 Markdown 的 ##而原稿段落中的“标题自带序号”如“들어가며 1”被原样保留在标题文本内未被剥离。 ### 3. 表格被还原为 GitHub Flavored Markdown 管道表 第 2 页的「[표 1] 감염병예방법 제2조제2호 개정전·후 비교」表 1传染病预防法第 2 条第 2 号修订前后对比被完整转换为标准管道表标题以普通段落行紧邻表格上方输出 markdown [표 1] 감염병예방법 제2조제2호 개정전·후 비교 | 구분 | 개정전 | 개정후 | | - | - | - | | 분류 | 1군 감염병 | 1급 감염병 | | 분류 기준 | ◦ 마시는 물 또는 식품을 매개로 발생하고 집단 발생의 우려가 큰 감염병 | ◦ 생물테러감염병 또는 치명률이 높거나 집단 발생의 우려가 커 높 은 수준의 격리가 필요한 감염병 | | 대상 질병 | ◦ (6종) 콜레라, 장티푸스, 파라 티푸스, 세균성이질, 장출혈 성대장균감염증, A형간염 | ◦ (17종) 에볼라, 페스트 등 * 좌측 6종(2급 감염병 분류)은 미포함 | | U코드 | ◦ 대상질병에 U코드 없음 | ◦ 대상질병에 U코드 일부(3종) 포함 ① 신종감염병증후군 → 코로나19(U) ② 중증급성호흡기증후군(SARS) (U) ③ 중동호흡기증후군(MERS)(U) |注意两处细节其一原 PDF 中“表 1 修订前后比较”的每个单元格跨越多行Docling 的表格导出compact_tablesTrue把折行合并为单行并以空格连接其二表内项目符号◦、①与空格被原样保留说明该导出路径是“以版面单元文本为最小输入”的无损合并而非重排。基准数据生成代码中doc_result.document.export_to_markdown(compact_tablesTrue)verify_utils.py正是这一“紧凑表格”开关的出处。4. 图片只剩!-- image --占位注释Markdown 产物中没有图片二进制或 caption 文本仅在图片锚点处输出占位注释!-- image --全文共出现 3 处第 1 行页眉 logo 区域、第 39 行与第 164 行正文插图处。对照 doctags 中picture标签出现位置完全一致。也就是说该 Markdown 基准不承诺图片内容保真只承诺“图片的位置与存在性”被标记出来。若需要在导出后回填图片可参考 docs/examples/export_figures.py 一类基于 DoclingDocument 的图片导出流程另行消费。5. 脚注以正文流内嵌方式保留韩国研究简报有大量脚注编号1)…10)。在 Markdown 产物中它们并非标准 Markdown 脚注语法而是以“正文中保留引用号 脚注全文按阅读顺序排布为普通段落”的形式落地例如한편 코로나-19가 전 세계적 유행단계에 돌입한 와중에 국내 보험업계에서는 코로나-19를 과연 질 병으로 보아야 할지, 상해 1) 나 재해 2) 로 보아야 할지 1) 손해보험의 표준약관 규정에 따르면, 보험기간 중에 발생한 급격하고도 우연한 외래의 사고로 신체에 입은 상해라고 규정하고 있는데, ... 2) 생명보험은 표준약관 재해분류표에서 우발적인 외래의 사고를 재 해라고 정의하며 ...对于“正文引用处含上标号、页面底部有脚注定义”的复杂版面Docling 会把脚注识别为独立 body 元素并按阅读顺序插入其语义由 doctags 的footnote标签承载Markdown 基准因此能用来锁定脚注不被遗漏、不被张冠李戴。同时可以观察到多栏 PDF 中被分行的韩文如 “재 해”、“질 병”、“보 험금”在导出后被合并成连续词组说明导出层完成了连字符/断行粒度的文本规整。样本内容总览这份“标准答案”究竟记录了怎样一份文件为便于读者核对基准文本的覆盖范围这里给出normal_4pages.md的完整内容结构以韩文原标题为准附中文说明。这也是该样本在端到端测试中能够覆盖“多级标题 表格 多栏 脚注 插图 页眉页脚”多种元素的原因刊头区발행일 2020년 4월 2일2020-04-02 发行、발행처 국회입법조사처韩国国会立法调查处、제1695호第 1695 号等元信息以普通文本段落输出摘要指出 2020.1.1 起《传染病预防法》相关条款变更后WHO 将 COVID-19 认定为“全球大流行Pandemic”引发保险实务中对“住院/死亡的灾害认定”的混淆文章旨在梳理条款现状、问题并给出改进方案들어가며引言截至 2020.3.30 韩国确诊 9,661 人、死亡 158 人WHO 于 2020.3.11 宣布进入大流行阶段争论焦点是 COVID-19 属于“疾病”“伤害”还是“灾害”——这一节附带第 1)、2) 号脚注分别给出损害保险与生命保险标准条款对“상해伤害”与“재해灾害”的定义并引出 KCD 的 S80~Y84 / U00~U99 分类代码背景코로나-19 관련 보험 현황COVID-19 相关保险现状分四个子节展开——(1) 《传染病预防法》修订前后对比即上文的表 1涉及 1군→1급 感染病分级、6 种→17 种目标疾病、U 代码引入(2) 生命保险标准条款“灾害分类表”虽然把第 1 级传染病列为保障对象却将 U 代码U00~U99疾病如 SARS(U04.9)、MERS(U19.9) 排除COVID-19 的疾病代码 U07.1 因此可能被解释为不支付灾害保险金(3) 《条款规制法》第 5 条的“起草者不利解释原则”약관의 뜻이 명백하지 아니한 경우에는 고객에게 유리하게 해석; (4) 生命保险业界以“可测风险Measurable Risk”为由主张原则上不予保障문제점问题点(1) 若保险公司主张 U07.1 属免责事由将违背作为上位法的《传染病预防法》修法宗旨(2) 金融监督当局未能及时修订生命保险标准条款(3) 业界依据大数法则第 8 号脚注与收支相等原则第 9 号脚注认为新发传染病的风险率不可测算导致各公司给付口径不一(4) 面对气候、传染病等新风险保险商品开发能力不足개선과제改进课题(1) 依据条款规制法与“事故发生当时适用法律”的条款约定重新审视灾害保险金给付(2) 呼吁监督当局尽快完成标准条款修订并采取积极政策(3) 建议开发传染病保险、参数保险Parametric Insurance第 10 号脚注详述其“以降雨量、风速等客观指标赔付而非实损赔付”的运行机制、指数保险Index Insurance等新形态商品맺으며结语COVID-19 具备“偶发性外来事故 急剧性”的灾害属性建议监督当局与业界尽快完成制度性补正末段为刊物说明为议员立法活动服务的信息通讯编号 ISSN 2005-744X 等在页脚中被剔除。上述所有事实性表述病例数、WHO 声明日期、法律生效日、疾病分类代码 U07.1 等均可在基准文本 normal_4pages.md 的对应段落中直接查证本文不做任何扩充性转述。基准如何被“喂”进回归测试四种检查一次跑全以normal_4pages为代表的 PDF 基准由端到端测试驱动。核心入口是 tests/test_e2e_conversion.py 中的test_e2e_pdfs_conversions()它遍历tests/data/pdf/sources/下全部 PDF逐份调用converter.convert(...)再对每一份执行 verify_utils.py 中check_conversion_result_v2()的四项独立检查cells比对预测页与*.pages.meta.json的逐页版面单元数normal_4pages对应[60, 120, 80, 82]docitems将预测的DoclingDocument与*.json基准做结构化比对标题、文本、表格、图片等条目的逐项校验markdown把预测文档用export_to_markdown(compact_tablesTrue)导出、经_normalize_newlines()统一换行后与*.md基准文本比较doctags把export_to_doctags()结果与*.doctags.txt比较对列入SKIP_DOCTAGS_COMPARISON的样本可关闭。值得注意的设计check_conversion_result_v2不会“一个检查失败即中断”而是把每个失败收集为VerificationFailure并全部汇报保证一份坏文档不会掩盖其他文档的真实状态test_e2e_pdfs_conversions最终将结果渲染成 PASS/FAIL 表格后统一断言。此外在generateTrue基准再生成模式开关见 tests/test_data_gen_flag.py下同一函数会把四个基准文件全部重写——这保证“基准”与“校验逻辑”同源、可再生成而不是手工维护的死数据。要在本地复现回归# 在仓库根目录执行转换并校验全部 PDF 基准 python -m pytest tests/test_e2e_conversion.py -q # 单独校验多页样本的“页面全部到位”行为 python -m pytest tests/test_failed_pages.py -q控制样本的双重身份既是基准也是“正常对照”normal_4pages不仅在 markdown 基准层被使用还被 tests/test_failed_pages.py 用作“正常 PDF”对照该测试用StandardPdfPipelinePdfPipelineOptions(do_ocrFalse, do_table_structureFalse)配置转换该文件并断言其转换状态为ConversionStatus.SUCCESS、result.document.pages恰好包含 1..4 全部页码、且result.errors为空。它验证的正是 docling-core 的“即使个别页面解析失败也要保留失败页以保证页码连续与分页标记正确”这一修复见文件头部注释引用的 docling-core PR 466在完全正常的 4 页 PDF 上不会误伤。换言之normal_4pages是测试矩阵中的“黄金基线”正常文档必须不触发任何失败页逻辑而 markdown 基准又必须与版面预测严格一致。消费同一份数据的另一入口直接加载 JSON 做下游实验normal_4pages的转换结果还被镜像到示例数据目录 docs/examples/data/normal_4pages.json并被 docs/examples/trivial_chunking.py 直接消费。该示例实现了一个“透传 chunker”子类化BaseChunker后把 DoclingDocument 中的每个 DocItem标题、文本、表格、图片…按阅读顺序输出为一个DocChunk不分组也不合并使下游可做元素级索引。运行方式为python docs/examples/trivial_chunking.py【免费下载链接】doclingGet your documents ready for gen AI项目地址: https://gitcode.com/GitHub_Trending/do/docling创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考