第53课 · 使用 AI 的数据安全问题
用 AI 编程工具处理工作,最担心的就是——我的数据会不会泄露?客户底稿会不会被拿去训练?
这节课不讲空泛的安全理论,直接给你一张各家厂商的评分对比表,告诉你哪些工具可以放心用客户数据,哪些只能拿来学习练手。
本节要点
- 两条路解决安全问题:花钱做私有化部署,或者看懂付费版的服务协议
- AI 编程工具不会直接上传你的文件:它写代码读取表结构,只把文本片段发给大模型,不是全量上传
- 五个维度给厂商打分:是否训练用户数据、训练政策是否说清楚、数据留存多久、能不能关训练、数据存国内还是国外
- 个人版 ≠ 安全版:智谱 Coding Plan 个人版的订阅协议对训练只字未提,但通用的《用户协议》写明「匿名化后可用于训练」——个人版请默认按「会被训练」对待
- 国外厂商被腰斩的原因:数据出境是审计红线,CLOUD Act 允许美国政府调取美企数据
- 免费网页版(DeepSeek、豆包等)一定被训练——不用抱侥幸心理
- 选型建议:客户数据走国内 API(明确不训练),自学练手用国外也行,永远别用国外厂商处理客户底稿
1. 为什么财务审计人必须关心?
你平时用 AI 编程工具做的事——读科目余额表、处理函证清单、跑合并底稿——这些数据一旦泄露,后果比普通行业严重得多:
| 风险 | 具体后果 |
|---|---|
| 客户底稿外泄 | 贴进去的函证清单、合并底稿,没关训练开关就可能进模型库——被同行查出来就是事故 |
| 数据出境违规 | 用国外工具处理客户数据,数据默认存到美国,触发《数据出境安全评估办法》《数据安全法》——罚款 + 声誉损失 |
| 商业机密流失 | 审计方法、客户名单、收费报价、尽调结论——一旦成为训练语料,等于把事务所核心竞争力送出去 |
| 协议藏猫腻 | 同一家厂商,消费者版默认训练、企业版默认不训练;有些协议条款写在小节里玩文字游戏——必须逐条核对 |
2. 两条路:花钱 or 看协议
2.1 路线一:花钱做私有化部署(公司层面)
如果你所在的事务所或公司真金白银地担心数据安全,有三种方案:
方案一:用 AI 厂商的私有化平台
AI 厂商提供隔离的算力服务平台,不需要你自己买硬件。比如阿里云的 PAI 平台,它的私有化服务和公有云是隔离开的。你可以让 AI 去帮你调研有哪些平台,也可以直接联系你对应的服务供应商,让他们给你方案。
方案二:买硬件自己部署
现在国内开源模型已经很强大了——GLM、Kimi、DeepSeek 都可以自己部署。但硬件成本很高:
- 部署满血版(完整参数量):可能上千万
- 部署量化版本(非满血版,比如 DeepSeek):100 万左右可以搞定
方案三:租显卡
有些芯片厂商(比如摩尔线程)提供租显卡的服务。临时想用一下,按需租用,不用一次性投入硬件成本。
核心原则
公司层面要安全,归根结底就是花钱。不花钱、不信协议、又要绝对安全——没有这种好事。
2.2 路线二:看懂付费版服务协议(个人/小团队)
如果你不打算买硬件,那就认真看你用的 API 或 Coding Plan 的服务协议。
关注两个核心问题:
- 是否不留存数据——用完就删,不保存
- 是否会被用于训练——你的输入会不会变成模型的训练语料
现在的厂商基本都推出了企业版或团队版:
- 智谱 GLM Coding Plan 团队版——明确不训练用户数据
- 其他厂商也有类似的团队版/企业版
但要注意区分版本:
团队版 vs 个人版:很多厂商的团队版明确写了不训练,但个人版要么没声明、要么在通用协议里明确保留了训练权利(比如智谱,实锤条款见 4.4 节)。买之前一定看清是哪个版本的协议,个人版一律默认「会被训练」。
君子协议
服务协议都是「君子协议」——厂商承诺不留存、不训练,你选择信任。如果你连协议都不信,那就回到第一步:花钱做私有化部署,没得跑。
3. AI 编程工具不会直接上传你的文件
很多人担心:「我本地有一堆 PDF、Excel,用 AI 编程工具会不会全被上传?」
答案:不会。
AI 编程工具的工作方式不是把文件直接上传,而是:
读取文件结构 → 写代码处理 → 只把文本片段发给大模型具体来说:
- 它写代码去读取文件——比如先读 Excel 的表头和列名,而不是把整个文件传上去
- 发给大模型的是文本信息——比如列名、数据类型、部分数据样本,而不是全量文件
- 你本地的 PDF、Excel 文件本身不会被上传
这是一个重要的认知——AI 编程工具的交互方式和对聊网页版(把整段文字贴进去)不一样,它的数据传输量要小得多。
4. 各家厂商数据安全对比
4.1 五个评分维度(满分 10 分)
我让 AI 去调研了各家厂商的服务协议,从五个维度打分:
| 维度 | 权重 | 评分逻辑 |
|---|---|---|
| ① 是否训练用户数据 | 2.5 分 | 不训练满分 / 可关闭较高分 / 默认训练低分 / 未明确最低分 |
| ② 训练政策是否说清楚 | 1.5 分 | 协议写得明确满分 / 模糊歧义低分 |
| ③ 数据留存时长 | 1.5 分 | 不存储满分 / 短期较高 / 长期较低 |
| ④ 有没有关闭训练的开关 | 1.5 分 | 有关闭开关满分 / 部分版本有 / 无开关零分 |
| ⑤ 数据存储位置(红线) | 3.0 分 | 国内满分 / 国外+驻留部分分 / 国外最低分 |
第⑤维度为什么权重最高?
数据存储位置(国内 vs 国外)是审计红线。 国外厂商技术再好,处理客户数据 = 违规。国内《数据出境安全评估办法》《数据安全法》《个人信息保护法》明确规定,客户数据出境需要安全评估,未经评估就是违规。而且美国 CLOUD Act 允许美国政府调取美国公司的境外数据——Claude、OpenAI、OpenCode 都是美国公司,即使签了 ZDR(零数据留存)协议,也改变不了物理存储位置在美国的事实。
4.2 A 类:各家自带的 AI Agent 工具(开箱即用)
这类工具是厂商自己做的开箱即用产品,比如腾讯 WorkBuddy、智谱 ZCode、Kimi Work 等。
| 厂商工具 | 训练 | 留存 | 可关 | 存储 | 评分 |
|---|---|---|---|---|---|
| 腾讯 WorkBuddy | ✅ 不训练 | 用后即弃 | ✅ 可关 | 🇨🇳 国内 | 9.8 |
| 智谱 ZCode | ✅ 不训练 | 必要期 | ✅ 默认关 | 🇨🇳 国内 | 9.7 |
| Kimi Work | ⚠️ 训练可关 | 必要期 | ✅ 可关 | 🇨🇳 国内 | 9.0 |
| 小米 MiMo Code | ✅ 不训练 | 完成删除 | ✅ 默认 | 🇨🇳 国内 | 8.9 |
| Trae 国内版(字节) | ⚠️ 训练可关 | 必要期 | ✅ 隐私模式 | 🇨🇳 国内 | 8.0 |
| Claude Code (API) | ✅ 不训练 | 默认不留 | ✅ ZDR | 🇺🇸 美国 | 7.5 |
| OpenAI Codex (API) | ✅ 不训练 | 30 天 | ✅ ZDR | 🇺🇸 美国 | 7.2 |
| OpenCode Go | ❌ 条款会使用 | R2 实锤 | ❌ 无 | 🇺🇸 美国 | 3.0 |
OpenCode Go 四大风险
- 公司在美国旧金山,受特拉华法律管辖 → 数据出境
- 条款并未承诺「不留存」——原文是「may use Content to further develop and improve our Services」(可以使用内容来改进服务)
- GitHub Issue 实锤:完整 prompt/completion 存入 Cloudflare R2,留存期限未公开
- 无关闭开关
学 AI 编程可以,别贴客户数据。
4.3 B 类:API / Coding Plan / Token Plan(接 OpenCode 用)
这类是你买了 API 或套餐后,接入 OpenCode、Claude Code 等第三方工具来用。
| 厂商套餐 | 训练 | 留存 | 可关 | 存储 | 评分 |
|---|---|---|---|---|---|
| 硅基流动 | ✅ 不留存不训练 | 不留存 | ✅ 默认 | 🇨🇳 国内 | 10.0 |
| 小米 MiMo Token Plan | ✅ 默认不训练 | 不存储 | ✅ 需同意 | 🇨🇳 国内 | 10.0 |
| 阿里云百炼 | ✅ 绝不训练 | 会存储 | ✅ 默认 | 🇨🇳 国内 | 9.7 |
| GLM Coding Plan 团队版 | ✅ 不训练 | 180 天 | ✅ 团队默认 | 🇨🇳 国内 | 9.5 |
| Kimi 会员订阅 | ⚠️ 训练可关 | 必要期 | ✅ 可关 | 🇨🇳 国内 | 9.0 |
| DeepSeek API | ⚠️ 协议歧义 | 必要期 | ❌ API 无开关 | 🇨🇳 国内 | 6.0 |
| GLM Coding Plan 个人版 | ❌ 匿名化可训练 | 必要期 | ❌ 无 | 🇨🇳 国内 | 5.5 |
| 腾讯 TokenHub | ❓ 未明确 | 7 天 | ❓ 未明确 | 🇨🇳 国内 | 5.3 |
| MiniMax API | ❓ 未明确 | 必要期 | ❌ 无 | 🇨🇳 国内 | 5.2 |
DeepSeek API 协议歧义
DeepSeek 的隐私政策总则说「适用于 API」,且「输入输出用于模型训练」的条款写在智能对话小节里;但开放平台服务小节没有声明不训练,也没提供关闭开关。条款位置矛盾,所以按低分 6.0 处理。
处理敏感数据前,建议向 DeepSeek 销售书面确认训练政策。
4.4 同一家厂商,版本不同安全等级也不同
特别注意:智谱 GLM Coding Plan 分团队版和个人版:
- 团队版(9.5 分):团队套餐协议明确写了「数据默认不用于模型训练」,产品页承诺「提交的代码、提示词、对话内容等不会用于模型训练,保护企业核心研发资产」
- 个人版(5.5 分):订阅协议对训练只字未提——但别以为「没提」就等于「没说」,个人版同时受平台通用协议约束,那里写得清清楚楚
智谱个人版的三个条款实锤(2026-09 逐条核实)
个人版没有专项数据协议,通用的《用户协议》《隐私政策》里反而明确了训练通道:
- 匿名化后可训练——《用户协议》原文:「我们可能会对收集的信息进行匿名化的研究、统计分析和预测……包括使用匿名数据进行机器学习或模型算法训练……此类数据已不属于个人信息范畴,因此无需另行征得您的同意」
- 你贴的内容被永久授权——非个人信息内容(你贴的代码、文字、表格片段)「免费授予智谱及其关联公司非排他的、无地域限制的、永久的、免费的许可使用……及可再许可第三方使用」
- 没有开关、无法撤回——「匿名化」在法律上已不算个人信息,所以不存在任何退出选项;「我没同意训练」这个说法在个人版不成立
对写代码的人来说,第 2 条比训练条款更值得警惕——你贴进去的底稿片段、脚本、数据样本,都落在这份永久授权的范围内。
团队版条款也别抠死了
团队版协议的原文是套餐内容「可能包括:数据默认不用于模型训练」——两个限定词要注意:「可能」(以你签的订单页为准)和「默认」(不是绝对禁止)。产品页写得更笃定,但严格来说,买团队版时最好让销售把这句写进订单或合同。
其他厂商也有类似情况——第三方调研(国内AI平台数据隐私政策调查报告)的结论与此高度一致:个人版 Coding Plan 默认会被训练,团队版/企业版才有「不训练」承诺。选择时务必看清楚你买的是哪个版本的协议。
5. 为什么国外厂商分数被腰斩?
Claude、Codex 技术一流,训练政策也明确(不训练 + ZDR),但分数只有 7 分左右,原因就是数据存储位置在国外。
| 维度 | Claude Code API | OpenAI Codex API | OpenCode Go |
|---|---|---|---|
| 技术力 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| 数据政策 | 7 天 + 不训练 + ZDR | 30 天 + 不训练 + ZDR | 条款矛盾 + R2 疑点 |
| 存储位置 | 🇺🇸 美国 | 🇺🇸 美国 | 🇺🇸 美国 |
| 能处理客户底稿吗? | ❌ 出境违规 | ❌ 出境违规 | ❌ 出境 + 不透明 |
三个层面的风险:
- 违反中国法规——《数据出境安全评估办法》《数据安全法》《个人信息保护法》都规定客户数据出境需安全评估
- CLOUD Act 风险——美国政府可以调取美国公司的数据
- 合规成本高——欧盟数据驻留需要企业版,价格翻几倍
结论:技术上 Claude/Codex 是顶级的,但处理中国客户数据 = 合规红线。学习练手可以,客户项目换国内。
6. 三档选型建议
根据数据敏感程度,分三档推荐:
🚫 第一档:机密数据(客户合并底稿、函证、IPO 申报材料)
推荐:
- 腾讯 WorkBuddy(本地优先,文件不离机)
- 硅基流动 / 小米 MiMo Token Plan
- 阿里云百炼 / GLM Coding Plan 团队版
禁用: 任何国外厂商 慎用: DeepSeek API(协议歧义)
⚠️ 第二档:一般工作(数据分析脚本、底稿模板、报告润色,已脱敏)
推荐:
- GLM Coding Plan 团队版
- Kimi API / WorkBuddy / ZCode
注意: DeepSeek API 先书面确认训练政策
📚 第三档:学习探索(学 AI 编程、写自动化脚本、不涉客户)
推荐:
- Claude Code / Codex(学技术,技术领先)
- OpenCode Go(练手可以,别贴客户数据)
7. 如何关闭数据训练
如果你用的是个人版或消费者版工具,很多都有关闭训练的开关,只是藏得比较深:
| 工具 | 关闭路径 | 备注 |
|---|---|---|
| DeepSeek(消费者网页版) | 头像 → 设置 → 数据管理 → 关闭「数据用于优化体验」 | ⚠️ API 端无此开关 |
| Kimi Work / 网页版 | 设置 → 隐私 → 关闭「对话用于改进 Kimi」 | 开放平台 API 默认不训练 |
| 智谱 ZCode | 设置 → 常规 → 关闭「优化计划」 | 默认就是关的 |
| 腾讯 WorkBuddy | 账号 → System Settings → 关闭「Experience Optimization Program」 | 企业版合同明确不训练 |
| 字节 Trae 国内版 | 设置 → 账号 → 开启「隐私模式」 | 代码库文件始终不训练 |
| Claude Pro/Max | claude.ai/settings/data-privacy-controls → 关闭「Help improve Claude」 | Claude Code 用 API Key 默认不训练 |
| ChatGPT Plus/Pro | 头像 → Settings → Data controls → 关闭「Improve the model for everyone」 | API 默认不训练 |
没有关闭选项的工具(处理客户数据前避开)
DeepSeek API · MiniMax API · 腾讯 TokenHub · OpenCode Go · 智谱 GLM 个人版
8. 免费网页版 vs 付费 API
最后一个重要区分——你用的是免费的还是付费的?
免费网页版(DeepSeek 网页版、豆包等)
一定会被训练。 没有例外。
这些工具都是免费的,厂商给了你明确的说明:数据会被用于训练。你可以在它们的协议里看到——这是用免费换数据的交易。所以用免费网页版时,不要抱侥幸心理,不要贴敏感数据。
付费 API / Coding Plan
需要看服务协议。 付费版有商业合同约束,很多厂商明确承诺不训练、不留存。这就是为什么本课重点讨论的是付费版的协议对比。
9. 四个容易踩的坑
⚠️ 四个易被忽视的坑
- OpenCode Go 看似用国产模型(GLM/Kimi/MiMo),但 OpenCode 公司在美国,数据先出境再调国内模型——坑!条款还说「may use Content to improve」,并非「不留存」
- 腾讯 WorkBuddy 中国版(workbuddy.cn)数据存国内、北京主体,但官网隐私政策链接错误指向国际版(新加坡主体)——查协议认准
privacy.qq.com/rule.tencent.com - DeepSeek API 协议歧义:训练条款在智能对话小节,开放平台小节没说不训练,按低分处理
- 「没说不训练」≠「安全」——智谱个人版订阅协议确实没提训练,但通用《用户协议》写明匿名化后可训练;而且注销账号也删不干净:注销协议写的是「删除或匿名化处理」,匿名化存续的数据仍可用于训练。敏感数据从一开始就别贴,别指望事后补救
10. 官方协议去哪里核实?
本课所有评分都基于厂商官方协议,以下是关键链接,使用前请自行点击核实(厂商政策随时可能更新):
国内厂商:
- 智谱 ZCode:隐私政策 · 用户协议
- GLM Coding Plan:团队版协议 · 个人版订阅协议(对训练只字未提)· 用户协议(个人版的训练条款在这里)· 隐私政策
- 阿里云百炼:隐私说明
- 硅基流动:隐私政策 · 用户协议
- 小米 MiMo:隐私 · Token Plan
- 腾讯 WorkBuddy:隐私保护指引 · 服务协议
- Kimi:消费者隐私 · 服务协议
- DeepSeek:开放平台协议 · 隐私
- 字节 Trae:用户协议 · 隐私模式
国外厂商(⚠️ 数据出境):
小结
| 要点 | 说明 |
|---|---|
| 绝对安全 = 花钱 | 私有化部署(厂商平台 / 买硬件 / 租显卡),不花钱不信任协议又要安全,没有这种好事 |
| 看协议关注两点 | 是否不留存数据、是否不训练数据——这是付费版的核心指标 |
| AI 工具不上传文件 | 它写代码读取表结构,只发文本片段给大模型,不是全量上传 PDF/Excel |
| 数据出境是红线 | 国外厂商技术再好,处理客户底稿 = 违规 |
| 版本区分 | 团队版/企业版往往明确不训练;个人版没承诺 = 默认会被训练(智谱个人版甚至在通用协议里写明匿名化可训练,注销也不删匿名化数据) |
| 免费网页版必被训练 | DeepSeek、豆包等免费工具,协议明确写了数据用于训练 |
| 选型原则 | 客户数据 → 国内 API(明确不训练)· 自学练手 → 国外也行 · 协议有歧义就当它会训练 |
一句话总结:你都相信微信和 QQ 传文件,为什么不信国内大厂给你的协议? 真正敏感的数据就私有化部署,一般的数据选国内大厂明确不训练的套餐就行。