*本文首发于“IBL国际商事法律实务”公众号
上篇梳理了国内的监管框架与制度不足,本篇给出解决路径:监管基线 + 合规采购 + 用途路由,以及行业走向与律师角色的展望。
太长不看版(省流)
上篇结论:C端聊天产品(DeepSeek 网页版/APP、豆包、腾讯元宝等)只问概括性问题;保密事项只走承诺不训练的企业级轨道(阿里云百炼、百度千帆企业版、火山方舟企业 API、DeepSeek 开放平台等)。本篇讲怎么落地。
真正承重的是监管基线+合规采购+用途路由,不是律师逐条手工脱敏。
采购三件套:选择双备案的服务商;据《个人信息保护法》第21条把零训练/优化、输入内容不留存、审计、隔离落进协议(国内无零留存,争取"日志最小化");可行时叠加TEE机密计算。
用途路由按律所既有数据分级分三档:A类绝密只进内网自建,B类高敏可进条款达标的合规云AI(无需手工脱敏),C类公开材料可自由使用。
把委托合同中预先披露AI使用写进去,告知同意前置,省去事后补签。
幻觉三道防线:接权威数据库(RAG)→多模型交叉验证→律师终审,责任不可转移。
律师的角色不是"数据清洗工",而是"路由决策者":什么不交出去、走哪条轨道、归哪一档——这才是个体不可替代的判断。
解决方案:
多维度的应对路径
先把各条路径的分量说清楚。真正起作用的是两件事:国家管住服务商,律所用合同把底线固化下来。靠律师逐条手工清洗数据,既不现实,方向也不对。
落到个体层面,律师能做的不是清洗数据,而是判断用途:这件事能不能交给 AI,该交给哪一类产品。用企业级 API 的,核心动作是选商和签数据处理条款,供应商提供机密计算(TEE)时优先采用;用 C 端产品的,核心动作是限定用途,只问概括性问题。输入端脱敏在两条轨道上都不构成防线,至多是处理低风险信息时的一点额外减损。
(一)两条轨道:C端产品与企业级调用
可信执行环境(TEE)可以在硬件层面为 AI 推理构建一个"加密保险箱",让数据在运算过程中对服务商的运维人员也不可见。《人工智能科技伦理审查与服务办法(试行)》要求 AI 科技活动采取加密、访问控制、审计等技术措施防范伦理风险,TEE 是落地这类要求的路径之一,但该办法并没有点名强制使用 TEE。目前阿里、腾讯等头部厂商已在企业级 AI 产品中探索 TEE 选项,虽未成为行业标配,方向上已被业界与监管共同认可。
它的边界也要看清楚。第一,TEE 主要解决的是云厂商内部人员偷看明文这一类威胁,并不阻断侧信道攻击(业界已有真实的利用案例,这是持续的攻防博弈),也难以防范 Prompt 注入导致的组合性泄露,模型有可能把 enclave 内本应保密的内容经由看似合法的推理路径带出来。第二,部署门槛不低,需要远程证明、密钥管理和专门的工程投入,通常要花上数月并依赖稀缺人才,不是开箱即用。第三,目前多数面向律师的 AI 产品还没有把 TEE 做成可以勾选的选项。
所以 TEE 是加分项,应当叠加在合同审计与人工终审之上,而不是替代它们。采购时还要核验向量库、内容审核和子处理者是否处在同一个可信边界之内。
(二)法律与合同层面:以《个人信息保护法》第 21 条落实数据处理条款
《个人信息保护法》第 21 条要求与受托人约定委托处理的目的、期限、处理方式、个人信息的种类、保护措施以及双方的权利和义务等,并对受托人的个人信息处理活动进行监督,实务中通常以书面数据处理协议落实。这是律师采购 AI 时数据处理条款的法定基础。
国内实践中,律所一般不会与厂商单独签一份 GDPR 式的独立 DPA,但头部厂商的企业版或 API 服务协议已经内含了这些核心义务,包括不用于训练和优化的零训练承诺、数据隔离和审计条款。需要注意一个限制:国内厂商普遍只承诺零训练,不承诺零数据留存。因《网络安全法》(2025 修正)第二十三条第(三)项(原第二十一条第(三)项)与《互联网信息服务深度合成管理规定》第十条的法定留存义务,"零保留"在国内并非默认。采购企业版或 API 时,应确保以下三类条款落地:
1. 输入内容不留存
交互完成后不留存可识别的输入与输出文本内容
2. 内部访问审计与留痕
要求服务商建立运维人员访问的完整审计日志体系,使谁在何时查看了哪些数据可以追溯
3. 专属实例或 VPC 隔离部署
从物理或逻辑上隔绝其他租户接触数据的可能
这里要界定一下"零数据留存"。绝对意义上的零数据留存(ZDR,连运维和审核日志也一律不保留),是 OpenAI、Anthropic 等对合格企业客户提供的 GDPR 延伸实践。我国因前述网安法第二十三条第(三)项与深度合成规定第十条的法定留存义务,国内厂商无法照搬。国内合规能达到的目标是输入输出文本不留存,加上日志最小化(按最短法定期限保留、日志不含可识别的输入文本、受审计与最小权限约束),到期删除或匿名化,这也契合《个人信息保护法》第 19 条关于存储期限最小化的要求。
这几条条款针对的正是上篇讲的偷看盲区与日志留存矛盾:监管暂时穿不透的地方,先用合同把口子扎住。它的适用对象是企业级用户;C 端条款不可谈判,无从以合同补强,这也再次说明那条轨道只能承载概括性问题。
(三)操作层面:用律所既有的数据分级做用途路由
先澄清一个流传很广的误解。传统那种换个名字、改几个数字的人工脱敏,能挡住人类读者和简单的数据库关联,却挡不住 AI 的推理能力。研究表明,大模型可以从上下文、准标识符的组合以及语言习惯反推身份,现行的文本匿名化难以有效抵御 LLM 的身份推断,效果远不足以依赖(Staab 等,ICLR 2024;Nature SR 2023)。更关键的是,这种处理在法律上属于去标识化而非匿名化(《个人信息保护法》第 73 条),处理后仍然是个人信息,并不因此减免 PIPL 项下的义务。指望律师逐条手工把案情剥到 AI 认不出来,既不现实,也难以穷尽。
所以把输入端脱敏当作使用 AI 的底线,方向就错了。可行的做法是用途路由,而最省事的分类标准不是另造一套抽象分层,而是直接读取律所既有的数据分级,以及这份材料能否经企业邮箱、网盘等第三方合规云传输的既有政策。后者本就是律所已经接受的信任模型:有合同约束的第三方云是可以接受的。企业级 AI 建立在同一个信任模型上,还多了 TEE 这一层保护,因此可以按同样的方式使用,无需手工脱敏,正如发邮件、传网盘之前没有人会逐条脱敏。
这个类比有前提,即不训练、输入内容不留存、合同条款落实到位。AI 推理相比存储传输还多出自动化转换、模型供应链与输出传播几个环节,所以"可经邮箱或网盘传输"只说明委托合同允许该信息进入第三方渠道,能否输入云 AI,仍需逐个产品核验其受托处理地位。
C 端产品在所有档位下都只承载概括性、一般法律规则的问题,任何具体的保密事项都不进。这条纪律与材料分级无关,是产品本身的性质决定的。
委托人告知与同意:合规 AI 与日常处理无本质差别,但以受托处理为前提。
第一,合法性基础是第十三条第(二)项"为订立、履行合同所必需",律师处理案卷信息源于委托合同,处理目的始终是办理委托事项;依第十三条第二款,有前款第二项至第七项规定情形的,不需取得个人同意(通说认为其涵盖敏感个人信息的单独同意),此为本文论证的主干。
第二,服务商仅为受托处理者:当服务商承诺不训练、不持久留存正文,并以合同落实数据处理条款时,其法律地位与复印机、外包助理同类,而不是自行决定处理目的的新处理主体。
第三,退一步说,即便回到同意基础,敏感个人信息的单独同意针对的是"处理"而不是"每次操作",委托合同已对处理敏感信息作出授权与披露的,也可视为告知与同意的合同化实现。
但这里要画一条明确的边界:一旦服务商条款允许把输入用于训练、优化或产品改进,其法律地位就从受托处理者转为《个人信息保护法》第二十三条意义上的"其他个人信息处理者",律所向其提供客户信息,须另行告知接收方信息并取得单独同意,而且这项义务不限于敏感信息。也就是说,"无本质差别"的结论以不训练、不留存、合同落实为前提;越过这条线,就回到了 C 端产品不得承载保密事项的结论。这也提示律所,与其事后补签,不如在委托合同中预先披露"可能使用经合规评估的 AI 工具辅助处理",把告知同意做在前面。
还须坦承一个边界:以上论证以委托人的个人信息为对象。案卷中大量存在的第三方个人信息(对方当事人、证人、第三人的病历、银行流水、行踪轨迹等),其合法性基础并非委托合同,因为第十三条第(二)项覆盖的是"个人作为一方当事人的合同"。PIPL 对此缺乏类似 GDPR"合法利益"的明确兜底基础,属于立法层面的固有难点,不因是否使用 AI 而改变。正因如此,把这类信息放在受托处理、不训练、不留存的封闭环境中并遵循最小必要,是现行法下风险最低的做法,这反过来也支持了本文的结论。

A 类绝密只进内网,B 类高敏可进合规云 AI,C 类公开材料可自由使用
(四)选商层面:建立合规白名单
只选择已通过国家网信办大模型备案和算法备案的服务商。备案是准入性的合规信号,网信部门也明确备案不代表对主体、算法或产品的认可,因此它不等于政府背书。在此基础上,优先选择已部署 TEE 等机密计算技术、并愿意在采购协议中落实输入内容不留存与审计条款的产品。
《人工智能拟人化互动服务管理暂行办法》确立的"敏感个人信息不得用于训练",可以作为一条参照的高标准红线,该办法主要面向情感陪伴类服务,这里取其高标准的精神:凡训练条款涵盖敏感个人信息又没有给出便捷退出机制的,原则上不予采用。此外还要核验合同主体、处理地点、灾备区与子处理者清单,确认"境内供应商"不等于数据与支持人员全部位于境内。
(五)输出可信层面:先防、再查、最后人工把关
数据合规之外,另一类关切是输出失真。解法其实很清楚,工程上也已经落地,可以归纳成三道防线。
第一道是预防,从源头降低编造。把 AI 接到权威的专用数据库,用检索增强(RAG)替代模型凭记忆生成。北大法宝 MCP(mcp.pkulaw.com,已上线)提供"修正生成幻觉-法条""案号识别与溯源"等工具,底座是 580 万以上法规、1.7 亿以上案例;企查查 MCP(agent.qcc.com,已上线)以统一社会信用代码为锚点从源头压制幻觉(上线状态以官方公布为准)。让法条与案例的引用来自可溯源的权威库而非参数记忆,能在生成端有效压低编造率,但无法完全消除。
第二道是检测,多模型或多 agent 交叉验证。同一个法律问题用不同模型分别作答,比对二者引用的法条和案例。不同模型同时编造出同一个假案的概率较低,可以作为筛查信号;一旦出现差异就要亮红灯,最终仍须打开权威原文核对案号、法院、日期与裁判要旨。企查查官方也提倡多源交叉互证,用实时数据、招股书与内部资料三源比对。
第三道是裁决,最终由律师人工审核批准。这是不可委托的终局闸门,也正是各地律协指引反复强调的:律师是最终责任人。

幻觉三道防线:RAG 检索增强 → 多模型交叉验证 → 律师终审裁决
(六)制度层面:行业自律与律所内部管理
2.5 节指出的两类制度短板,需要落到可执行的制度设计上。
行业自律层面,律协指引应当从试行的笼统原则,升级为可以照做的操作标准:明确数据分级口径并与律所既有分级衔接、给出合规云选型清单、规定 AI 输出的核验流程,并与国家监管的备案和审计要求衔接。
律所层面,需要建立成体系的内部 AI 管理制度,至少包括四项:AI 工具白名单,以国家双备案为前置过滤;与既有数据分级挂钩的用途路由规则,把 A、B、C 三档对应的不同做法写进所内流程;使用留痕与监督预警,做到谁、何时、用何工具、处理何类材料都可审计;以及定期复盘与培训。
制度层的意义在于,把合规采购与用途路由从个体经验转化为组织能力。即便国家监管尚未完全到位,律所与律师仍然有可以依赖的内部防线。
未来预期:
监管趋严,但“不自建”仍是主流方向
(一)监管与治理趋势
从一刀切禁用走向能力导向与问责导向。法律行业曾经出现过"一律禁用生成式 AI"的保守做法,部分法院、行政机关和律所都这么试过,其根源是对 AI 机制的理解不足,把使用 AI 当成了一种同质化的风险,没有区分用途(概括性咨询与具体保密事项)和数据敏感度(可经邮箱网盘传输与仅限内网)。但 AI 的风险取决于用途和合同,而不取决于用不用这件事本身,正确的回应是按材料分级做用途路由、用合同把底线固化,而不是禁掉工具。
现在的治理方向印证了这一点。上海市司法局等指导编制的《法律服务领域大模型部署应用指引》(2026.7,全国首部法律服务领域大模型部署规范)明确了辅助工具的定位、关键环节强制人工复核留痕、敏感数据不出域;纽约州法院 Part 161 规则(2026.6)允许律师使用 AI,但要求独立核实输出;厦门海事法院《诉讼参与人使用人工智能指引(试行)》允许在诉讼中合理使用 AI,但须独立核验并披露。可见监管与司法的趋向是管住人的核验与责任,而不是禁掉工具。(与法律工具无关的内容治理类规则,如情感陪伴类 AI 的管理办法,不在本文讨论范围。)
技术合规指标会进一步硬化,但要理性看待。机密计算等方向有望从可选的高级功能逐步成为企业级服务的常态化要求。但它在法律 AI 产品中尚不是可以勾选的标配,也替代不了合同审计,宜作为加分项看待。
过程监管将逐步弥补结果监管的不足。强制审计日志、操作留痕等要求预计会进一步细化,从制度上压缩内部人员查看数据的空间。
处罚力度持续加码。《个人信息保护法》第六十六条规定,违法处理个人信息情节严重的,可处五千万元以下或者上一年度营业额百分之五以下罚款。已有执法先例:2025 年 9 月,公安网安部门在"护网—2025"专项工作中发现,某主营 AI 模型训练基础数据(算料)的科技公司,在处理人脸等生物识别类敏感个人信息前未按规定开展个人信息保护影响评估(PIA),被依法予以行政处罚并责令整改(国家网络安全通报中心 2025 年 9 月 15 日通报,细节以官方口径为准)。
行业自律与律所内控将逐步硬化。律协指引会从笼统原则细化为可落地的数据分级口径、合规云选型清单与输出核验流程;AI 工具白名单、用途路由规则、使用留痕与监督预警,也会从自发探索转为律所内部制度的标配,乃至行业考核与监管检查的内容。
(二)行业格局:对标网盘与云服务的信任治理模式
先说一个常被误解的前提。律师最常用的那些高质量模型,无论境外的 GPT、Claude、Gemini,还是国内的豆包、文心一言旗舰、讯飞星火,旗舰版多为闭源,官方不开放权重,根本无法下载到本地服务器运行,只能经 API 或企业版、私有化网关调用,数据仍然出网。所谓"自建服务器就安全",对这些闭源旗舰而言,本就不存在自建这个选项。(境外模型的数据出境等专属合规问题,留待专文讨论。)
当前这代开源权重模型(DeepSeek V4 Flash 满血版、V4 Pro 旗舰版、Qwen 3.6、GLM-5.2)虽可本地部署,但能力梯度很明显。轻量小模型只够做 OCR 和信息抽取;中等参数模型(如 Qwen 3.6)达不到律师对实质法律推理的质量要求;超大参数版本(如 DeepSeek V4 Pro 旗舰版)则需要数据中心级的多卡集群,投入以千万计,对中小型律所没有现实意义。以实战体感看,本地能承担核心推理的底线,至少是 DeepSeek V4 Flash 满血版(开源)这一级别,推理质量接近旗舰版。
有一点需要澄清:它虽然是 MoE 架构、每次只激活少量参数,但全部参数权重仍须完整载入显存(量化或 CPU 卸载可以降低显存门槛,但吞吐损失显著,通常不适用于律所的生产场景),显存占用由总参数量决定。它之所以可行,靠的是高效架构与量化带来的单位算力成本下降,而不是显存门槛低。所以想用轻量小模型应付的自建,对律师的核心工作没有实际意义。再加上合规私有化还须满足等保三级(裸金属、权限最小化、双因素认证、日志留存 6 个月至 3 年、WAF、季度审计),外加专用机房与专职运维,中小律所的安全团队很难比肩头部云厂商。
因此对绝大多数律所来说,不自建全量前沿超大模型,在经济和技术上都是更优的默认选择。但务实的出路既不是一律上云,也不是用轻量小模型应付,而是可控投入的有限自建:在律所内网自部署 DeepSeek V4 Flash 满血版这一级别的开源推理模型,用来承载 A 类高保密事项的实质法律推理。
至于自建到底有多贵,要算全账,而不是只看显卡报价。以 30–50 人的中小所、部署 DeepSeek V4 Flash 满血版(开源)为例:一台 8 卡企业级推理服务器(国内合规渠道,如 H20 级)加上机房与网络配套,一次性投入通常约 ¥80–150 万(行情波动大,以实时报价为准);每年的硬性成本,包括电费制冷、运维人力、等保三级与安全审计、维保,约 ¥25–70 万;若把一次性硬件按 3 年折旧分摊,年总成本约 ¥50–120 万,折合人均约 ¥1–4 万/人/年。这里要说明,3 年折旧只是会计上的均匀分摊,未必对应 AI 硬件的真实迭代节奏:模型能力呈台阶式跃升,硬件可能在折旧期内就因为显存与算力门槛被突破而提前淘汰、残值归零,算力闲置更是常态。相比之下,消费级量化部署(整机约 ¥20–40 万)只能跑重度量化版,质量有可见的折损,达不到律所核心推理的可用门槛。
▷结论
高敏感的内部推理用本地的 V4 Flash 满血版级模型,一般事项走合规云,按材料分级与风险高低来选,而不是一律自建或者一律上云。
(三)律师角色:从清洗数据到判断用途
未来律师在这件事上的着力点,应当从自己动手清洗数据,转向依靠监管与合同解决问题。这里要先纠一个常见的误解:"逐条手工脱敏"并不是曾经合理、如今被升级的做法,它从一开始就建立在对 AI 原理的误解之上。它既挡不住大模型从上下文反推身份,也不减免 PIPL 项下的义务,不应被赋予任何"曾经正确"的背书。正确的做法分三层。
依托监管基线
以国家双备案和备案白名单作为前置过滤,信赖受监管的头部供应商,而不是让每位律师都去自建机房或者充当数据合规工程师。
做实合规采购
选商时要求进入政府备案白名单,签约时在采购协议中落实零训练、零优化、输入内容不留存、审计等数据处理条款,可行时争取 TEE;国内不承诺零留存,高敏感事项争取私有化部署。监管尚未明文的要求,先在合同里固化下来。
个体判断用途
据律所既有的数据分级,判定哪些材料禁走第三方云 AI、哪些可以走合规云、哪些概括性问题可以在 C 端产品上处理。对不承诺不训练的产品,律师真正该做的不是把数据洗干净,而是清醒地判断什么不交出去。
顺带澄清两种朴素的想法。一是以为脱敏之后就能投喂,但脱敏属于去标识化,挡不住 LLM 从上下文反推身份,也不减免 PIPL 义务。二是以为自建服务器就万事大吉,但常用的 GPT、Claude、Gemini 以及国内的豆包、文心一言、讯飞星火等闭源旗舰根本无法本地部署,只能走 API,数据仍然出网;即便用开源模型,超大参数版本需要数据中心级的多卡集群,投入以千万计,还要满足等保三级的服务器要求,经济上不成正比;而轻量小模型只够做 OCR 和信息抽取,真正够用的本地推理至少要 DeepSeek V4 Flash 满血版级别,需要多卡企业级 GPU 或大内存量化,这与"随手自建一个小模型就能办案"的想象相去甚远。

律师的角色不是"数据清洗工",而是"路由决策者"
一个审慎而务实的结论
在服务商已履行备案、承诺不训练、律所采购了企业级产品,并落实了合同义务、审计安排与子处理者核验的前提下,律师使用 AI 在模型端的泄密风险可以控制在较低水平。目前最主要的监管盲区,也就是内部人员查看动态数据的问题,正在被技术手段(机密计算作为合同审计的强化层)与制度设计(强制审计、合同留痕)逐步填补。律师无需因噎废食走向自建,而应把精力放在选商、签约与判断用途这三件事上。
技术的边界会移动,规则的牙齿会变硬。对律师而言,最可靠的防线从来不是某一次手工脱敏,而是一套可信的合规框架加上一条清醒的使用纪律:选已备案的供应商,签含输入内容不留存与审计条款的采购协议,在可行的受控环境中处理具体事项;而对不承诺不训练的产品,只问概括性问题,不投喂负有保密义务的具体事项。把客户秘密交出去之前的那一次专业判断,才是最该依赖的防线,因为它既独立于平台的承诺,也独立于任何人的手工清洗能力。律师在 AI 时代的职责,不是做数据清洗工,而是做那个决定什么交出去、走哪条轨道的人。
团队介绍
万商天勤律师事务所IBL国际商事法律服务团队由多位拥有外资律所或海外工作经验的律师组成。团队致力于为客户提供公司事务与投融资、国际贸易、海商海事、能源、保险和商事争议解决相关的法律服务。
本文作者
黄伟杰

合伙人
上海办公室
huangweijie@vtlaw.cn
高怡雯

律师
上海办公室
gaoyiwen@vtlaw.cn