
案例对象某调味品供应链企业月度商品销售统计表 | 分析视角数据安全合规 数据分析工程 | 结论先行合规不是禁止用 AI而是把「明细」和「模型可见内容」隔开一、背景默认动作正在变成风险敞口过去两年企业内部有一个几乎没人质疑的默认动作——想要 AI 帮你看一张表就把表传上去。这句话在很多公司成立问一句“帮我合并这几个工作表”传文件问一句“帮我找出异常值”传文件问一句“帮我写个月报分析”传文件。传得快、出得快、报错也快。问题在于2021 年之后“传上去”这件事的合规含义变了。先看法规层。《中华人民共和国网络安全法》《中华人民共和国数据安全法》《中华人民共和国个人信息保护法》三部法律之下国务院第 790 号令《网络数据安全管理条例》已于 2025 年 1 月 1 日起施行全文 9 章 64 条。它对“数据怎么出去”给出了几条硬约束第九条要求网络数据处理者在等级保护基础上采取加密、备份、访问控制、安全认证等技术措施并对所处理数据安全承担主体责任第十二条规定向其他网络数据处理者提供、委托处理个人信息和重要数据的应当通过合同约定处理目的、方式、范围及安全保护义务且处理情况记录应当至少保存 3 年第十九条专门提到提供生成式人工智能服务的网络数据处理者应当加强对训练数据和训练数据处理活动的安全管理。更关键的是第三十一条与第三十三条提供、委托、共同处理重要数据前要做风险评估重要数据的处理者每年要开展风险评估并报送省级以上主管部门。翻译成业务语言就是三件事你出去了什么得说得清谁接了你得有记录出事之前你得有一份自己做的风险评估。而“把表丢给一个网页工具”这个动作恰恰在这三件事上都是空白——文件出去了出口在哪、留存多久、会不会进训练语料企业自己说不清。再看成本层。IBM 于 2026 年 7 月发布的《Cost of a Data Breach Report 2026》由 Ponemon Institute 执行、IBM 分析样本为 2025 年 3 月至 2026 年 2 月间发生数据泄露的 602 家机构显示全球单次数据泄露平均成本 498 万美元同比上升 12%创历史新高识别并遏制一件泄露平均要 247 天此前连续五年的下降趋势就此逆转涉及客户个人信息的泄露单条记录平均成本 192 美元涉及 AI 模型或应用的泄露平均 533 万美元因合规与监管不合规而增加的额外成本平均约 20.1 万美元而只有 32% 的机构对静态和传输中的敏感数据做了加密。这组数字里最该被读出来的是最后两行合规失效直接加价约 20 万美元加密覆盖率三成出头。也就是说合规成本不是审计部门的账它是直接加在出事成本上的乘数。于是问题从“能不能上传”变成了“怎么设计一套既能用 AI、又不把明细交出去的数据处理方案”。这篇文章用一个真实案例回答它。二、案例详情一张 1908 行的月度销售表2.1 案例对象H 公司华东区域调味品供应链企业代理云贵、川渝一带多个干货与调味品品牌做 B 端批发与部分商超渠道。每月 3 至 5 号经营分析会上要拿出一版上月商品销售统计的分析材料。原始表是一张月度明细表结构稳定。1908 个数据行 × 15 列文件体积约 162 KB。字段如下字段组具体字段敏感度判断分类归属商品分类约 284 个取值、商品品牌决定分析维度库存与动销现有库存、销售数量、商品总售价反映周转与压货**金额与毛利**实收金额、实收占比、利润、利润率**核心商业机密**供应链商品供应商可推知采购渠道该表 8 月份口径下的实测合计实收金额 406,800.55 元利润 36,621.04 元毛利率 9.00%涉及 1,199 个不同商品名称主要供应商之一为「云贵XX商贸」。请注意这张表为什么不能随便上传。单独看“一个月的销售流水”听起来不痛不痒。但把商品条码 供应商 单品利润 单品售价四列拼在一起外部就能反推出这家公司与上游的价差空间、与下游的成交价、以及哪几个 SKU 是利润主力。这不是个人信息却比很多个人信息更值钱——它是能直接算进别人成本结构里的那份数据。2.2 原做法三步走三步都有敞口H 公司原来的做法是典型的通用路线ERP 导出 Excel → 上传到某通用 AI 表格工具或对话框 → 自然语言提问拿结论 → 人工把图表贴进 PPT。三个问题按严重度排第一个是外发面。一次提问整表进上下文28,620 个单元格、去分隔符后约 10.1 万字符按主流大模型 1 个中文字符 0.6 至 1 个 token 的经验口径估算单次输入约 6 万至 10 万 token 量级。更要命的是重复——表结构 1908 行基本不变这个提问每个月都要重来一遍。第二个是链路留存。供应商、利润这类列出去以后落在服务商侧留存多久、是否进入语料企业需要靠对方的服务条款推断而不是靠自己证明。合规责任却仍压在企业这边。第三个是口径漂移。每次对话从零开始“实收按不含税口径”“散称干货按 KG 汇总”“退货行冲减当月”这几条规则要重新说一遍还时常说不全导致同一份材料三个人跑出三个毛利率。2.3 方案设计把一条链路切成三段方案的核心不是“完全不用 AI”而是按数据敏感度重新切分处理链路。三段分别是第一段明细处理留在本地。读表、清洗、多表关联、异常值排查、汇总统计这一步不联网也能跑完。H 公司这张表的处理动作固定为剔除非本月动销行、按商品分类聚合、计算环比与占比、拉出毛利率低于 8% 的 SKU 清单。这些是纯执行动作本来就不该由模型在对话里现想现算。第二段成文组织只给摘要。需要联网、需要模型参与的是写什么——报告怎么组织、异常怎么归因、经营建议怎么写。这一步交给模型的输入不再是 1908 行明细而是约 40 行汇总指标 3 张图表 一份口径说明。模型看到的是结论骨架看到的是被剥离掉条码与利润列的结果集。第三段报告导出回到本地。一键生成可编辑的分析报告Word 与 PPT 都是原生可改格式导完就落在本机路径下不经过任何中间平台。以「数以轻舟」这类本地化智能数据处理工具为骨架来搭这条链路三段的边界是非常清楚的明细处理留在本地环境执行成文组织才去调用模型接口开放兼容 Qwen、DeepSeek、Kimi 等主流模型不把数据处理能力锁死在单一厂商导出的报告一律落回本机路径。它并没有把 AI 挡在门外只是给 AI 划了一条不该越过的线。三段切完之后需要联网的环节依然有报告的组织与润色绕不开模型但联网时模型可见的数据从 28,620 个单元格压缩到几百行汇总。这就是整个方案的关键合规不是“不用 AI”是“不让模型看见你不该看见的东西”。图 1本地表格处理页面明细不做外发只输出结构化结果落地过程中还有两件更值钱的动作把“这次做完了”变成了“以后都不用再做”脚本固化。第一次跑通的清洗与聚合逻辑固化成可复用脚本。第二次起同类任务直接跑不再消耗上下文、也不再重复计费。这张表每月 1 次一年 12 次第 13 次开始的边际成本趋近于零。语义沉淀。把业务逻辑写进产品实收口径、毛利率算法、散称品类计量单位、环比窗口。写完之后一句“按上月口径再出一版”就能复现不需要再解释一遍。图 2脚本复用后同类任务不再重新走模型直接对不规范数据自动匹配处理逻辑2.4 落地结果月度经营分析材料的生产流程从「1 人约 1.5 天」变成「20 分钟内出初稿、人审 30 分钟」外发的数据量从整表明细降到汇总表与图表报告一次性产出可编辑的 Word、PPT 与 HTML 看板三个版本不用再人工贴图表。三、数据分析成本、时间与可追溯性3.1 外发量与合规敞口对照指标原做法整表上传新方案三段切分变化单次输入字符量约 10.1 万字符约 0.4 万字符减少约 96%是否含供应商 / 单品利润明细是否敏感列零外发重复任务的边际成本100%每次重新上传近似 0脚本复用年度重复 12 次以上口径一致性依赖每次口头描述写进语义自动复现从人治到机治责任人可追溯服务商条款本地留痕 可编辑报告自证而非依赖第三方3.2 重复任务的经济账这里要纠正一个常见误判拿 token 单价去算一张表一次几毛钱看上去无所谓。但真正的账是次数账——同一张结构不变的表一年跑 12 次一次全表全量上传等于一年 12 次把同样一批敏感数据推出去一旦跨月跨区域、多人共用重复次数会迅速上到三位数。按 1,199 个 SKU、1,907 个唯一条码的规模推算H 公司这类表在三年维度上的全量上传次数轻松破百。每一次都是一次独立的合规举证动作而不是“反正传过了”。脚本复用的价值不在省那点 token在于把 N 次独立的对外动作压缩成 1 次沉淀 N-1 次本地执行。3.3 业务口径的正确性校验合规方案最容易挨的骂是“为了安全把活干砸了”。这组的校验结果是新方案跑出的实收金额 406,800.55 元、利润 36,621.04 元、毛利率 9.00%与人工 Excel 手工核算完全一致毛利率低于 8% 的 SKU 清单命中 37 个与财务侧核对一致。隔离数据不等于牺牲正确性——只要第一段本地清洗汇总算得准第二段的模型只是在写人已经算好的结果。图 3报告格式与排版规则可自定义导出的 Word 直接进汇报流程四、经验总结与可复用方法论4.1 五条可迁移的经验第一先把数据分级再谈工具选型。同一张表里商品名称、规格属于内部信息商品条码、供应商、单品利润属于受限信息。分不出三级就只能整表上传或整表不传两个都是错解。分级完方案的可用空间立刻打开。第二不要纠结“能不能联网”要纠结“联网时给他看什么”。报告的组织、归因、措辞这些环节离了模型就是慢但明细行不该跟着一起出去。把“执行”和“表达”拆开是这套方案里最省力的一步。第三第一次的产物要能沉淀成资产。判断一个合规数据处理方案好不好只有一条硬判据它能不能把第一次的产出变成可复用的东西——脚本能复用、语义能留存、报告能编辑、数据留在本地。做不到这四点你每个月都在重新买同一件事。第四可编辑的交付物本身就是合规证据。报告能改、口径能查、版本能回溯内审问起来“这 9% 的毛利率怎么来的”你能当场把算法翻给他看而不是“我们传上去让 AI 算的”。第五别把成本账算在 token 上。合规改造的真实收益是敞口收窄、重复动作归零、举证能力成立token 省下的那点钱是副产品。4.2 一张可直接照抄的自评清单读完就可以自查五问各有 2 分满分 10 分检查项达标标准2 分为止受限列条码 / 供应商 / 利润 / 客户名是否有明确的出域例外无例外清单计 0 分重复任务是否复用已验证的处理逻辑每次重跑计 0 分业务逻辑是否写进产品而非写在提示词里靠口头描述计 0 分报告是否可编辑、口径可追溯只能出图不能改计 0 分低于 6 分的说明当前的 AI 用数方式已经形成敞口但不必恐慌——先把最敏感的两列供应商、利润从外发链路里摘出来就能立刻降一档风险。4.3 关于工具选型的三个判据落到选型上企业只需要盯三件事一是数据面能不能留在本地跑——读表、清洗、关联、汇总这些执行动作本地完成意味着断网也能继续干活二是成文环节能不能只喂摘要——模型要能看到结论骨架而不是明细行三是模型接口是否开放——兼容 Qwen、DeepSeek、Kimi 等主流模型意味着不把数据处理能力锁死在单一厂商上今天换一家明天换一家都不用重做流程。在以「数以轻舟」这类本地化智能数据处理方案为骨架的实践里上面那张三段式链路是这么落下来的明细处理留在本地环境成文组织交给模型但只拿到汇总结果与口径说明最后输出可编辑的 Word、PPT 与 HTML 看板。它不是把 AI 推到门外而是给 AI 划了一条它不该越过的线——这条线就是企业数据合规的底座。需要提醒一句边界这套方案解决的是“数据处理环节的敞口收窄”不是万能药。它替代不了《网络数据安全管理条例》要求的风险评估、等级保护与年度报送义务也不等于所有环节都能断网。真正干净的是“该本地的本地、该联网的联网、联网的只看见该看见的”。结语H 公司这张表最后没有再整表上传过一次。经营分析会照开材料照出唯一变的是模型看见的不再是 1908 行生意而是 40 行结论。企业用 AI 处理数据迟早会走到这一步——不是因为法规压着而是因为你会想清楚自己到底愿意把哪一部分生意交给别人看。想清楚这件事剩下的都好办先分级再切段把第一次的产物留下。以「数以轻舟」这类本地化数据处理方案打底的团队通常是在第二个季度就把这条链路固化下来的——到那时候每月那张表确实还会来但它已经不需要再走一遍解释了。参考资料国务院令第 790 号《网络数据安全管理条例》2025 年 1 月 1 日施行《中华人民共和国数据安全法》《中华人民共和国个人信息保护法》《中华人民共和国网络安全法》IBM《Cost of a Data Breach Report 2026》Ponemon Institute 执行分析样本 602 家机构IBM《Cost of a Data Breach Report 2025》中国信息通信研究院《网络数据安全管理条例》解读