问题的本质
「AI 会不会泄露我的数据」这个问题问得太笼统。把它拆成三层,答案就清楚了:数据在哪一层,决定了它有没有出网。
第一层:模型层(生成建议)
你把数据贴进对话框,让 AI 帮你写方法、写脚本。这一层数据确实过了网,进入了服务方的请求链路。
结论:这一层只喂脱敏的假数据。改字段名、把真实姓名换成「张三」、金额乘以随机系数,都行。目的是让它理解结构,不是让它看到真值。
第二层:执行层(实际处理)
写好的脚本、工具在你自己机器上跑,读本地文件、写本地目录。这一层不出网,断网也能运行。
关键原则:敏感的事让 AI 想办法,别让 AI 碰真数据。
补一句:「AI 技能」属于第二层,不是第一层
这里最容易混淆,单独说清楚。
让 AI 调用一个本地技能(Skill)去处理文件,和把数据贴进对话框,是完全不同的两件事:
| 贴进对话框 | AI 调用本地技能 | |
|---|---|---|
| 数据去哪 | 进入服务方请求链路 | 留在本机磁盘 |
| AI 看到什么 | 表格全部内容 | 只有你的指令和脚本回报的结果(拆了几组、文件在哪) |
| 属于哪一层 | 第一层(模型层) | 第二层(执行层) |
也就是说,你说一句「把这个文件夹按部门拆开」,AI 做的是判断该调哪个工具、参数怎么填,
真正读表、拆表、写盘的是本机上的脚本。表里的姓名和金额,模型自始至终没有看到。
这正好是上面那条原则的落地形态:让 AI 想办法,让本地程序碰真数据。
第三层:存储层(结果落盘)
结果保存到哪里,同样决定了风险。
- 保存在本地目录 → 风险等价于你本地磁盘的安全策略
- 保存到网盘 / 在线文档 → 又回到「出网」
- 上传到在线转换网站 → 这层最危险,很多在线工具会把文件留存
怎么判断一个工具到底联不联网
- 断网测试:关掉 WiFi / 拔网线再跑,能正常运行基本就是纯本地。
AI 技能要单独测:模型本身当然要联网,但它调用的执行脚本应该断网可跑——
断网后 AI 还能把文件拆出来,才说明数据确实没出去 - 看隐私政策:出现「上传」「云端处理」「用于模型训练」这类字样要警惕
- 流量监控:运行时观察有没有对外请求(Windows 可用资源监视器)
这三条比任何宣传语都可靠。
企业环境的现实约束
很多单位有明文规定禁止向外部服务传输工作数据。本地工具天然不触碰这条红线,报备流程也简单得多。
总结
- 把「让 AI 想方法」和「让程序去跑」分开,前者用假数据,后者在本地
- 敏感数据只在本机流转,断网可运行是硬性验收项
- 警惕在线转换类网站,那是最常见的泄露入口
- 选工具时先问一句:它断网能不能跑?
我处理工资表、客户资料时用的工具(ExcelRouter,开源 MIT)**
桌面版和 AI 技能版共用同一套内核,两条路都不出网:
- 桌面版免安装包,点开即下(Windows,约 52MB):ExcelRouter-Windows.zip
- AI 技能版:skillhub.cn/skills/excelrouter
- 源码可查,断网测试前建议先翻一眼有没有网络请求:GitHub · Gitee 国内镜像