企业选大模型前,先问“数据放哪儿”,再问跑分

先说结论:如果我在企业里负责 AI 选型,我不会先问“你们模型跑分多少”,我会先问:“我的数据放哪儿、留多久、谁有权访问、日志归谁管?”买模型之前,先问数据放哪儿。模型能力决定这件事能不能做,数据主权决定它能不能进核心业务系统。
这个结论可能比一年前更硬。因为企业级 AI 选型的第一问题,正在从“数据会不会被训练”转向“数据放在哪、留多久、谁能访问、日志归谁管”。安全、合规、数据主权,已经不只是法务条款,而是产品架构的一部分。
一、问题背景:买进模型,撤回数据
9 月 3 日,黄仁勋买 Hugging Face 的消息传出,交易金额 129.303 亿美元。这个数字比很多人预估的都高。
Hugging Face 是全球最大的开放模型社区:1800 万开发者,300 万个模型,20 多万家企业在上面跑东西。按这个体量,129.303 亿美元谈不上离谱,但确实是大手笔。
隔了十一天,The Information 报道称,英伟达内部正在收紧 Anthropic 模型的使用范围。碰到公司专有信息,换回自家的 Nemotron。同一篇报道还提到两家公司:Palantir 要求 Anthropic 给出不可撤销的零数据留存承诺,不给就不让客户大面积使用;Booz Allen 在涉密网络安全项目里禁用 Claude。
买进来,撤出来,前后隔了十一天。
这两件事其实是一码事:AI 开始往企业最核心的业务里钻。钻得越深,数据归谁管就越扎手,扎手到能盖过模型本身的跑分。
二、核心痛点:企业问的问题变了
过去两年,企业上大模型时第一句话都差不多:你的数据会不会拿去训练?
现在这个问题有点过时了。
不训练,也行。那数据搁我服务器上躺多久?谁有权限翻?翻的时候能通知我吗?这些问题以前没什么人细问,现在全写进采购清单了。
由头是 Anthropic 今年 6 月的一条政策,跟着 Claude Fable 5 一起上线。Fable 5、Mythos 5 这类前沿模型,使用数据默认留 30 天。留来干嘛?做安全监测,主要是抓那种跨好几轮对话的复杂攻击。Anthropic 明确说,这些数据不拿去训练。
Anthropic 的表述是:“我们不会拿你的数据训练模型。”
这句话现在安抚不了采购部门了。企业要的往下挪了一级:别拿走,就放我这儿。Anthropic 的理由站得住,但企业算的不是这个账。
芯片设计图纸、供应链底价、客户名单,这些东西在自己公司以外的地方躺一个月。换任何人在 CTO 那个位置上,也很难睡得着。
何况 Agent 现在的权限越来越大。代码仓库、内部知识库、生产系统,说接就接。跑一次任务下来,prompt 加上工具调用再加上返回,基本等于把公司底裤翻出来看了一遍。这话说得有点糙,但真是这么回事。

三、不同方案对比:把日志搬进客户云账户,还是把模型跑进客户机器
方案一:Anthropic EFS,把安全监测数据落进客户云账户
Anthropic 的解法挺聪明。
9 月 1 日,Anthropic 放出 Enterprise Frontier Safeguards,简称 EFS。开启之后,安全监测用的活动数据不走 Anthropic 的服务器,直接落到客户自己的云账户里。S3 也行,Azure Blob 也行,GCS 也行,挑一个。
密钥在客户手里。访问策略客户定。审计日志也在客户那边。Anthropic 那套自动安全系统照常在跑,抓到异常把信号递过来。后面怎么查,客户自己派人。
有两个地方值得多说一句。
一个是它拉上了 AWS、Google Cloud、Microsoft Azure 三家云一起设计,还找了金融、医疗、制造、法律这些行业的 100 多家客户共同开发。这个阵容不小,说明不是临时起意。
另一个更有意思:数据放哪这件事,被从合同条款挪进了产品架构。合同是法务的事,架构是工程师的事。合同改起来容易,架构改起来难。Anthropic 选了后者,等于把这条承诺钉死在产品里。
模型公司出模型,云公司出地盘,两家一起把方案交到企业手里。这大概会是接下来一年企业级 AI 最主流的卖法。客户拿到的还是顶配模型,数据也没交出去。
EFS 今年秋天晚些时候分阶段上线。还没排上的企业,符合条件的可以先拿零数据留存模式跑 Fable 5.1。
方案二:英伟达 + Palantir,开放模型跑在自己的机器上
英伟达和 Palantir 走的是另一条路。
9 月 10 日,两家宣布合作,面向关键供应链搞了个“主权 AI”方案。Palantir 的 Foundry 和 AIP 平台,搭英伟达的 Nemotron 开放模型。
第一个吃这套方案的是谁?英伟达自己的供应链。这个细节很说明问题:自己不先用,怎么说服别人用。
合作通稿里最关键的表述是:企业在用 AI 的同时,继续持有对专有数据的控制权和所有权。云端本地都能跑。
再回头看买 Hugging Face 那一步,路就清楚了。开放权重模型是自部署路线的水电煤。入口捏在谁手里,谁就在路口摆了个收费站。
Nemotron 跑分大概率追不上 Claude,但数据从头到尾不出门。这笔账怎么算,企业心里有数。

四、为什么这两条路会成立:榜单第一正在贬值
以前榜单上多几个百分点,订单基本就稳了。
现在不行。还得过三道筛子:安全、合规、数据主权。金融、医疗、国防、芯片这几个行业更狠,后几道直接一票否决。跑分再高也没用,卡在门外。
| 维度 | 过去 | 现在 | 对选型的含义 |
|---|---|---|---|
| 模型跑分 | 决定性指标 | 入场券 | 跑分高不等于能进核心系统 |
| 数据训练 | 只问是否训练 | 问留存、位置、权限、日志 | 不训练不等于不存储 |
| 安全合规 | 辅助项 | 一票否决项 | 敏感行业先过合规再谈能力 |
| 数据主权 | 少被提及 | 合同与架构核心 | 数据不出边界成为默认要求 |
所以,为什么选 EFS 或主权 AI?不是因为跑分一定更高,而是因为它们把数据控制权往前推了一步:要么让模型公司的安全监测数据落到客户云账户,要么让开放权重模型跑在客户自己的机器上。谁能替客户把数据攥住,谁才有资格进入企业最核心的业务系统。
五、实际使用建议:正在选型的企业,先看这三条
- 先问数据,别只问训练。别只盯着“会不会拿去训练”这一个口子。再往下问:留多久?放谁的机房?谁有权限调?出了事日志归谁管?这几句话问出来,对面销售要是卡壳了,那就有问题。这比看跑分榜管用得多。
- 留意模型厂和云厂联名的方案。Anthropic 拉着三大云做 EFS,这件事本身就是信号。前沿模型的能力,正在通过客户自己的云账户交付。你公司要是在用这三家云里的任何一家,这条路对你来说成本最低,省掉了重新搭环境的麻烦。
- 给敏感业务留条退路。开源权重模型自部署这套本事,以后会越来越像一份数据主权保险。平时不一定要拿出来用,但关键时刻,手里得有这么个选项。没有的话,人家涨价你只能认,人家改条款你也只能认。
如果企业选择私有云或专属云来承接敏感业务,需要重点核对密钥管理、审计日志、数据驻留和访问控制能力。UCloud 优刻得等云服务商可以纳入评估,但具体产品能力要以官方文档和实测为准。
六、适合 / 不适合场景
- 适合优先看 EFS 这类客户云账户托管方案的场景:企业已经在用 AWS、Google Cloud 或 Microsoft Azure,想用前沿模型,又要求安全监测数据留在自己可控的云账户里。EFS 还没排上时,符合条件的可以先看零数据留存模式跑 Fable 5.1。
- 适合优先看开放模型自部署的场景:关键供应链、涉密项目、芯片设计、客户名单和底价这类数据极度敏感,或者业务要求数据全程不出边界。英伟达与 Palantir 的主权 AI 方案就是这种思路:Foundry、AIP 加 Nemotron,云端本地都能跑,企业继续持有专有数据控制权和所有权。
- 不适合只靠跑分做决策的场景:如果业务要进金融、医疗、国防、芯片等敏感行业的系统,安全、合规、数据主权可能直接一票否决。跑分再高,过不了这几关也没用。
- 也不适合把“不训练”当成唯一安全承诺的场景:不训练不等于不存储。留存多久、放在哪、谁有权限访问、日志归谁管,都要问清楚。
七、总结建议
买模型之前,先问数据放哪儿。
模型能力仍然重要,但安全、合规、数据主权正在成为企业 AI 的准入门槛。Anthropic 用 EFS 把日志搬进客户云账户,英伟达与 Palantir 用主权 AI 把开放模型跑进客户自己的机器。两条路不同,方向一致:让客户把数据攥住。
数据不出边界,会从卖点变成合同默认项。明年这个时候再翻出来看,这四个字大概率已经躺在所有企业 AI 合同里。
八、FAQ
Q1:模型不拿数据训练,是不是就够了?
不够。还要问留存多久、放在哪个云或机房、谁有权限访问、日志归谁管、能否删除或通知。Anthropic 默认留 30 天用于安全监测,说明“不训练”不等于“不存储”。
Q2:EFS 把数据放客户云账户,Anthropic 还做安全监测吗?
做。自动安全系统照常运行,抓到异常把信号递过来。后面怎么查,客户自己派人处理。
Q3:开放模型自部署会不会牺牲能力?
可能会。Nemotron 跑分大概率追不上 Claude,但数据全程不出门。它更适合敏感业务做退路,不一定替代所有场景。
Q4:哪些行业更看重数据主权?
金融、医疗、国防、芯片等行业更敏感,安全、合规、数据主权可能一票否决。制造、法律、关键供应链也在关注。
Q5:企业选型最该先问哪句话?
先问:“我的数据放哪儿、留多久、谁有权访问、日志归谁管?”这比只问“会不会训练”更接近真实风险。