Skip to content

第53课 · 使用 AI 的数据安全问题

用 AI 编程工具处理工作,最担心的就是——我的数据会不会泄露?客户底稿会不会被拿去训练?

这节课不讲空泛的安全理论,直接给你一张各家厂商的评分对比表,告诉你哪些工具可以放心用客户数据,哪些只能拿来学习练手。

本节要点

  • 两条路解决安全问题:花钱做私有化部署,或者看懂付费版的服务协议
  • AI 编程工具不会直接上传你的文件:它写代码读取表结构,只把文本片段发给大模型,不是全量上传
  • 五个维度给厂商打分:是否训练用户数据、训练政策是否说清楚、数据留存多久、能不能关训练、数据存国内还是国外
  • 个人版 ≠ 安全版:智谱 Coding Plan 个人版的订阅协议对训练只字未提,但通用的《用户协议》写明「匿名化后可用于训练」——个人版请默认按「会被训练」对待
  • 国外厂商被腰斩的原因:数据出境是审计红线,CLOUD Act 允许美国政府调取美企数据
  • 免费网页版(DeepSeek、豆包等)一定被训练——不用抱侥幸心理
  • 选型建议:客户数据走国内 API(明确不训练),自学练手用国外也行,永远别用国外厂商处理客户底稿

1. 为什么财务审计人必须关心?

你平时用 AI 编程工具做的事——读科目余额表、处理函证清单、跑合并底稿——这些数据一旦泄露,后果比普通行业严重得多:

风险具体后果
客户底稿外泄贴进去的函证清单、合并底稿,没关训练开关就可能进模型库——被同行查出来就是事故
数据出境违规用国外工具处理客户数据,数据默认存到美国,触发《数据出境安全评估办法》《数据安全法》——罚款 + 声誉损失
商业机密流失审计方法、客户名单、收费报价、尽调结论——一旦成为训练语料,等于把事务所核心竞争力送出去
协议藏猫腻同一家厂商,消费者版默认训练、企业版默认不训练;有些协议条款写在小节里玩文字游戏——必须逐条核对

2. 两条路:花钱 or 看协议

2.1 路线一:花钱做私有化部署(公司层面)

如果你所在的事务所或公司真金白银地担心数据安全,有三种方案:

方案一:用 AI 厂商的私有化平台

AI 厂商提供隔离的算力服务平台,不需要你自己买硬件。比如阿里云的 PAI 平台,它的私有化服务和公有云是隔离开的。你可以让 AI 去帮你调研有哪些平台,也可以直接联系你对应的服务供应商,让他们给你方案。

方案二:买硬件自己部署

现在国内开源模型已经很强大了——GLM、Kimi、DeepSeek 都可以自己部署。但硬件成本很高:

  • 部署满血版(完整参数量):可能上千万
  • 部署量化版本(非满血版,比如 DeepSeek):100 万左右可以搞定

方案三:租显卡

有些芯片厂商(比如摩尔线程)提供租显卡的服务。临时想用一下,按需租用,不用一次性投入硬件成本。

核心原则

公司层面要安全,归根结底就是花钱。不花钱、不信协议、又要绝对安全——没有这种好事。

2.2 路线二:看懂付费版服务协议(个人/小团队)

如果你不打算买硬件,那就认真看你用的 API 或 Coding Plan 的服务协议

关注两个核心问题:

  1. 是否不留存数据——用完就删,不保存
  2. 是否会被用于训练——你的输入会不会变成模型的训练语料

现在的厂商基本都推出了企业版或团队版:

  • 智谱 GLM Coding Plan 团队版——明确不训练用户数据
  • 其他厂商也有类似的团队版/企业版

但要注意区分版本:

团队版 vs 个人版:很多厂商的团队版明确写了不训练,但个人版要么没声明、要么在通用协议里明确保留了训练权利(比如智谱,实锤条款见 4.4 节)。买之前一定看清是哪个版本的协议,个人版一律默认「会被训练」。

君子协议

服务协议都是「君子协议」——厂商承诺不留存、不训练,你选择信任。如果你连协议都不信,那就回到第一步:花钱做私有化部署,没得跑。


3. AI 编程工具不会直接上传你的文件

很多人担心:「我本地有一堆 PDF、Excel,用 AI 编程工具会不会全被上传?」

答案:不会。

AI 编程工具的工作方式不是把文件直接上传,而是:

读取文件结构 → 写代码处理 → 只把文本片段发给大模型

具体来说:

  1. 它写代码去读取文件——比如先读 Excel 的表头和列名,而不是把整个文件传上去
  2. 发给大模型的是文本信息——比如列名、数据类型、部分数据样本,而不是全量文件
  3. 你本地的 PDF、Excel 文件本身不会被上传

这是一个重要的认知——AI 编程工具的交互方式和对聊网页版(把整段文字贴进去)不一样,它的数据传输量要小得多。


4. 各家厂商数据安全对比

4.1 五个评分维度(满分 10 分)

我让 AI 去调研了各家厂商的服务协议,从五个维度打分:

维度权重评分逻辑
① 是否训练用户数据2.5 分不训练满分 / 可关闭较高分 / 默认训练低分 / 未明确最低分
② 训练政策是否说清楚1.5 分协议写得明确满分 / 模糊歧义低分
③ 数据留存时长1.5 分不存储满分 / 短期较高 / 长期较低
④ 有没有关闭训练的开关1.5 分有关闭开关满分 / 部分版本有 / 无开关零分
⑤ 数据存储位置(红线)3.0 分国内满分 / 国外+驻留部分分 / 国外最低分

第⑤维度为什么权重最高?

数据存储位置(国内 vs 国外)是审计红线。 国外厂商技术再好,处理客户数据 = 违规。国内《数据出境安全评估办法》《数据安全法》《个人信息保护法》明确规定,客户数据出境需要安全评估,未经评估就是违规。而且美国 CLOUD Act 允许美国政府调取美国公司的境外数据——Claude、OpenAI、OpenCode 都是美国公司,即使签了 ZDR(零数据留存)协议,也改变不了物理存储位置在美国的事实。

4.2 A 类:各家自带的 AI Agent 工具(开箱即用)

这类工具是厂商自己做的开箱即用产品,比如腾讯 WorkBuddy、智谱 ZCode、Kimi Work 等。

厂商工具训练留存可关存储评分
腾讯 WorkBuddy✅ 不训练用后即弃✅ 可关🇨🇳 国内9.8
智谱 ZCode✅ 不训练必要期✅ 默认关🇨🇳 国内9.7
Kimi Work⚠️ 训练可关必要期✅ 可关🇨🇳 国内9.0
小米 MiMo Code✅ 不训练完成删除✅ 默认🇨🇳 国内8.9
Trae 国内版(字节)⚠️ 训练可关必要期✅ 隐私模式🇨🇳 国内8.0
Claude Code (API)✅ 不训练默认不留✅ ZDR🇺🇸 美国7.5
OpenAI Codex (API)✅ 不训练30 天✅ ZDR🇺🇸 美国7.2
OpenCode Go❌ 条款会使用R2 实锤❌ 无🇺🇸 美国3.0

OpenCode Go 四大风险

  1. 公司在美国旧金山,受特拉华法律管辖 → 数据出境
  2. 条款并未承诺「不留存」——原文是「may use Content to further develop and improve our Services」(可以使用内容来改进服务)
  3. GitHub Issue 实锤:完整 prompt/completion 存入 Cloudflare R2,留存期限未公开
  4. 无关闭开关

学 AI 编程可以,别贴客户数据

4.3 B 类:API / Coding Plan / Token Plan(接 OpenCode 用)

这类是你买了 API 或套餐后,接入 OpenCode、Claude Code 等第三方工具来用。

厂商套餐训练留存可关存储评分
硅基流动✅ 不留存不训练不留存✅ 默认🇨🇳 国内10.0
小米 MiMo Token Plan✅ 默认不训练不存储✅ 需同意🇨🇳 国内10.0
阿里云百炼✅ 绝不训练会存储✅ 默认🇨🇳 国内9.7
GLM Coding Plan 团队版✅ 不训练180 天✅ 团队默认🇨🇳 国内9.5
Kimi 会员订阅⚠️ 训练可关必要期✅ 可关🇨🇳 国内9.0
DeepSeek API⚠️ 协议歧义必要期❌ API 无开关🇨🇳 国内6.0
GLM Coding Plan 个人版❌ 匿名化可训练必要期❌ 无🇨🇳 国内5.5
腾讯 TokenHub❓ 未明确7 天❓ 未明确🇨🇳 国内5.3
MiniMax API❓ 未明确必要期❌ 无🇨🇳 国内5.2

DeepSeek API 协议歧义

DeepSeek 的隐私政策总则说「适用于 API」,且「输入输出用于模型训练」的条款写在智能对话小节里;但开放平台服务小节没有声明不训练,也没提供关闭开关。条款位置矛盾,所以按低分 6.0 处理。

处理敏感数据前,建议向 DeepSeek 销售书面确认训练政策。

4.4 同一家厂商,版本不同安全等级也不同

特别注意:智谱 GLM Coding Plan 分团队版和个人版

  • 团队版(9.5 分):团队套餐协议明确写了「数据默认不用于模型训练」,产品页承诺「提交的代码、提示词、对话内容等不会用于模型训练,保护企业核心研发资产」
  • 个人版(5.5 分):订阅协议对训练只字未提——但别以为「没提」就等于「没说」,个人版同时受平台通用协议约束,那里写得清清楚楚

智谱个人版的三个条款实锤(2026-09 逐条核实)

个人版没有专项数据协议,通用的《用户协议》《隐私政策》里反而明确了训练通道:

  1. 匿名化后可训练——《用户协议》原文:「我们可能会对收集的信息进行匿名化的研究、统计分析和预测……包括使用匿名数据进行机器学习或模型算法训练……此类数据已不属于个人信息范畴,因此无需另行征得您的同意」
  2. 你贴的内容被永久授权——非个人信息内容(你贴的代码、文字、表格片段)「免费授予智谱及其关联公司非排他的、无地域限制的、永久的、免费的许可使用……及可再许可第三方使用」
  3. 没有开关、无法撤回——「匿名化」在法律上已不算个人信息,所以不存在任何退出选项;「我没同意训练」这个说法在个人版不成立

对写代码的人来说,第 2 条比训练条款更值得警惕——你贴进去的底稿片段、脚本、数据样本,都落在这份永久授权的范围内。

团队版条款也别抠死了

团队版协议的原文是套餐内容「可能包括:数据默认不用于模型训练」——两个限定词要注意:「可能」(以你签的订单页为准)和「默认」(不是绝对禁止)。产品页写得更笃定,但严格来说,买团队版时最好让销售把这句写进订单或合同。

其他厂商也有类似情况——第三方调研(国内AI平台数据隐私政策调查报告)的结论与此高度一致:个人版 Coding Plan 默认会被训练,团队版/企业版才有「不训练」承诺。选择时务必看清楚你买的是哪个版本的协议。


5. 为什么国外厂商分数被腰斩?

Claude、Codex 技术一流,训练政策也明确(不训练 + ZDR),但分数只有 7 分左右,原因就是数据存储位置在国外

维度Claude Code APIOpenAI Codex APIOpenCode Go
技术力⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
数据政策7 天 + 不训练 + ZDR30 天 + 不训练 + ZDR条款矛盾 + R2 疑点
存储位置🇺🇸 美国🇺🇸 美国🇺🇸 美国
能处理客户底稿吗?❌ 出境违规❌ 出境违规❌ 出境 + 不透明

三个层面的风险:

  1. 违反中国法规——《数据出境安全评估办法》《数据安全法》《个人信息保护法》都规定客户数据出境需安全评估
  2. CLOUD Act 风险——美国政府可以调取美国公司的数据
  3. 合规成本高——欧盟数据驻留需要企业版,价格翻几倍

结论:技术上 Claude/Codex 是顶级的,但处理中国客户数据 = 合规红线。学习练手可以,客户项目换国内。


6. 三档选型建议

根据数据敏感程度,分三档推荐:

🚫 第一档:机密数据(客户合并底稿、函证、IPO 申报材料)

推荐:

  • 腾讯 WorkBuddy(本地优先,文件不离机)
  • 硅基流动 / 小米 MiMo Token Plan
  • 阿里云百炼 / GLM Coding Plan 团队版

禁用: 任何国外厂商 慎用: DeepSeek API(协议歧义)

⚠️ 第二档:一般工作(数据分析脚本、底稿模板、报告润色,已脱敏)

推荐:

  • GLM Coding Plan 团队版
  • Kimi API / WorkBuddy / ZCode

注意: DeepSeek API 先书面确认训练政策

📚 第三档:学习探索(学 AI 编程、写自动化脚本、不涉客户)

推荐:

  • Claude Code / Codex(学技术,技术领先)
  • OpenCode Go(练手可以,别贴客户数据

7. 如何关闭数据训练

如果你用的是个人版或消费者版工具,很多都有关闭训练的开关,只是藏得比较深:

工具关闭路径备注
DeepSeek(消费者网页版)头像 → 设置 → 数据管理 → 关闭「数据用于优化体验」⚠️ API 端无此开关
Kimi Work / 网页版设置 → 隐私 → 关闭「对话用于改进 Kimi」开放平台 API 默认不训练
智谱 ZCode设置 → 常规 → 关闭「优化计划」默认就是关的
腾讯 WorkBuddy账号 → System Settings → 关闭「Experience Optimization Program」企业版合同明确不训练
字节 Trae 国内版设置 → 账号 → 开启「隐私模式」代码库文件始终不训练
Claude Pro/Maxclaude.ai/settings/data-privacy-controls → 关闭「Help improve Claude」Claude Code 用 API Key 默认不训练
ChatGPT Plus/Pro头像 → Settings → Data controls → 关闭「Improve the model for everyone」API 默认不训练

没有关闭选项的工具(处理客户数据前避开)

DeepSeek API · MiniMax API · 腾讯 TokenHub · OpenCode Go · 智谱 GLM 个人版


8. 免费网页版 vs 付费 API

最后一个重要区分——你用的是免费的还是付费的?

免费网页版(DeepSeek 网页版、豆包等)

一定会被训练。 没有例外。

这些工具都是免费的,厂商给了你明确的说明:数据会被用于训练。你可以在它们的协议里看到——这是用免费换数据的交易。所以用免费网页版时,不要抱侥幸心理,不要贴敏感数据

付费 API / Coding Plan

需要看服务协议。 付费版有商业合同约束,很多厂商明确承诺不训练、不留存。这就是为什么本课重点讨论的是付费版的协议对比。


9. 四个容易踩的坑

⚠️ 四个易被忽视的坑

  1. OpenCode Go 看似用国产模型(GLM/Kimi/MiMo),但 OpenCode 公司在美国,数据先出境再调国内模型——坑!条款还说「may use Content to improve」,并非「不留存」
  2. 腾讯 WorkBuddy 中国版(workbuddy.cn)数据存国内、北京主体,但官网隐私政策链接错误指向国际版(新加坡主体)——查协议认准 privacy.qq.com / rule.tencent.com
  3. DeepSeek API 协议歧义:训练条款在智能对话小节,开放平台小节没说不训练,按低分处理
  4. 「没说不训练」≠「安全」——智谱个人版订阅协议确实没提训练,但通用《用户协议》写明匿名化后可训练;而且注销账号也删不干净:注销协议写的是「删除或匿名化处理」,匿名化存续的数据仍可用于训练。敏感数据从一开始就别贴,别指望事后补救

10. 官方协议去哪里核实?

本课所有评分都基于厂商官方协议,以下是关键链接,使用前请自行点击核实(厂商政策随时可能更新):

国内厂商:

国外厂商(⚠️ 数据出境):


小结

要点说明
绝对安全 = 花钱私有化部署(厂商平台 / 买硬件 / 租显卡),不花钱不信任协议又要安全,没有这种好事
看协议关注两点是否不留存数据、是否不训练数据——这是付费版的核心指标
AI 工具不上传文件它写代码读取表结构,只发文本片段给大模型,不是全量上传 PDF/Excel
数据出境是红线国外厂商技术再好,处理客户底稿 = 违规
版本区分团队版/企业版往往明确不训练;个人版没承诺 = 默认会被训练(智谱个人版甚至在通用协议里写明匿名化可训练,注销也不删匿名化数据)
免费网页版必被训练DeepSeek、豆包等免费工具,协议明确写了数据用于训练
选型原则客户数据 → 国内 API(明确不训练)· 自学练手 → 国外也行 · 协议有歧义就当它会训练

一句话总结:你都相信微信和 QQ 传文件,为什么不信国内大厂给你的协议? 真正敏感的数据就私有化部署,一般的数据选国内大厂明确不训练的套餐就行。

© 2025 逆行的狗