DISC架构技术白皮书

DataSov 2026-07-03 21:59:50

 数据原位主权能力架构
Data In-situ Sovereign Capability Architecture
版本:V1.0
日期:2026年7月
发布机构:DataSov社区[1]
作者:DISC架构研究组

目录
摘要
一、理论溯源与思想升华
二、合规内化:DISC架构的法律基础
三、问题背景:旧地图的失灵
四、DISC架构概述
五、核心原则
六、能力三元论
七、核心组件:5+1能力编配体系
八、技术基石
九、行业实践
十、商业模式
十一、DISC架构的产业生态演进
十二、实施路线图
十三、DISC架构的挑战与局限性
十四、DISC架构的未来演进
术语表

摘要

DISC(Data In-situ Sovereign Capability Architecture,数据原位主权能力架构)是一套面向数据主权时代的企业级架构范式。它的核心主张是“数据不动,能力流动”——将数据留在产生它的物理和法律边界之内,将算法、模型、规则和策略作为“能力胶囊”安全地调度到数据所在地执行。

这一主张并非凭空创造。它是姚期智院士安全多方计算、谷歌联邦学习、方滨兴院士“数据不动程序动”等三十年学术探索与工程实践的必然结晶。在此基础上,DISC架构完成了关键的概念升维——将“程序”升维为“能力”,涵盖智能能力(AI模型)、逻辑能力(业务规则)和治理能力(合规策略)三类核心能力体,为能力市场的品类体系奠定了分类学基础。

DISC架构诞生的背景是三重历史性力量的交汇:全球超过140个国家颁布数据主权法律[2],AI正从辅助工具渗透到核心决策领域,企业渴望像搭乐高一样自由组合来自不同厂商的最佳能力而不被任何一家锁定。传统架构——无论云端SaaS还是本地私有化——都无法同时满足敏捷、合规和成本这三个基本要求。

DISC架构由一个内核、三项原则、五大核心组件、两种运行模式构成。它不是单一技术,而是一套完整的技术、商业和治理体系。本白皮书系统阐述DISC架构的核心理念、思想渊源、核心组件、技术基石、行业实践、商业模式和演进路径,为企业CIO、平台厂商决策者和创业者提供从理念到落地的完整行动指南。

一、理论溯源与思想升华

1.1 思想谱系:从“数据不动程序动”到“数据不动能力动”

DISC架构的核心主张“数据不动,能力流动”并非凭空创造的术语,而是建立在一段跨越三十年的学术探索、工程实践与法律演进基础之上,并在此基础上完成了关键的概念升维。

萌芽期(1995-2015)

隐私保护数据挖掘(PPDM)作为一个正式的研究领域,诞生于世纪之交的学术界[3]。核心问题是“如何在保护个体隐私的前提下,从数据中挖掘出有价值的模式和知识”,这是“可用不可见”思想的最早学术表达。虽然当时的技术手段还相当原始——主要是数据扰动和匿名化——但问题框架已经建立。

姚期智院士在1982年提出的“百万富翁问题”开创了安全多方计算(MPC)领域的理论根基[4]。其核心思想极具前瞻性:多个参与方可以在不泄露各自私有输入的前提下,共同完成某个函数的计算。进入2000年代,MPC从纯理论走向协议设计与效率优化,为后来的联邦学习奠定了密码学基础。

成型期(2016-2021)

2016年,谷歌正式提出“联邦学习”概念[5]。背景是智能手机用户在设备上输入的大量文本数据涉及高度个人隐私,不能上传到云端集中训练。谷歌的解决方案是革命性的:模型在每台设备上本地训练,只上传加密的梯度更新,原始数据永不离开设备。“数据不动,模型动”这一核心范式正式确立,标志着“数据不动”从学术构想走向工业级应用。

联邦学习在随后几年迅速分化出三种范式[6]。横向联邦学习适用于不同样本、相同特征的场景——两家不同城市的银行,客户群体不同但交易特征类似,各自本地训练,共享模型参数。纵向联邦学习适用于相同样本、不同特征的场景——银行和电商有共同用户,但各自持有不同维度的数据。联邦迁移学习应对最困难的情况——样本和特征都很少重叠。安全多方计算的密码学成果与联邦学习开始深度融合,姚期智院士三十年前奠定的理论在工业界找到了大规模应用场景。

升华期(2022-2023)

2022年,方滨兴院士在BCS大会上正式提出“数据不动程序动”这一更宏大的表述[7]。这是一次关键的概念升维:不仅是AI模型的梯度可以流动,SQL查询语句可以流动,数据分析算法可以流动,业务规则引擎可以流动,合规审计脚本也可以流动。“程序”的外延远大于“模型”,所有“计算”都可以流动,而不仅仅是“模型训练”。

方滨兴团队同时提出了关键的工程架构——“模型加工场”。核心理念是调试环境与运行环境分离:数据需求方在调试环境中使用仿真数据开发程序,通过安全审核后,程序被下发到数据所在的可信执行环境中运行。计算结果需经过“防水堡”技术智能审核,确认不包含原始数据片段后才可输出。这套架构为“数据不动程序动”提供了完整的工程闭环。

鹏城实验室依托“中国算力网”国家级基础设施,将这套架构在多语言翻译、基因数据安全开放、政务数据融合等场景中进行了大规模验证,相关成果入选行业年度重大科技进展[8]。

共识期(2024至今)

2024年,欧盟《人工智能法》正式通过。该法鼓励使用隐私增强技术(PETs)来平衡数据保护与AI创新,为“数据不动”类技术路径提供了法律层面的正面背书[9]。技术共识开始上升为法律共识。

中国的《数据安全法》确立的数据分类分级制度、重要数据不出境要求[10],《个人信息保护法》规定的委托处理监督义务、敏感个人信息的严格保护标准[11]——这些法律要求与“数据原位处理”的技术原则高度契合。法律的刚性约束正在成为技术变革的最强驱动力。

1.2 DISC架构的升维:从“程序”到“能力”

DISC架构继承了“数据不动程序动”的全部思想遗产,并完成了关键的概念升维——将“程序”进一步升维为“能力”。

这一升维的必然性在于:在实践中,“程序”这个概念仍然偏重技术执行层。一个AI模型、一个规则引擎、一个合规策略都是“程序”,但它们的商业属性、安全要求、交付方式和价值度量完全不同。把它们笼统地称为“程序”,掩盖了它们在商业和技术上的本质差异。

因此,DISC架构将流动的“能力”定义为三类核心“能力体”:

智能能力——从数据中学习模式的AI模型、联邦学习参数、推理脚本。以加密容器镜像形式流动,按调用次数或节点数计费。

逻辑能力——在数据上执行判断的业务规则引擎、决策树、风控策略集。以版本化的策略代码包形式流动,按员工数或业务量计费。

治理能力——守护数据底线的数据脱敏算法、访问控制策略即代码、合规审计脚本。以动态注入的策略插件形式流动,按审计频率或数据源数量计费。

这一分类不仅是对技术形态的区分,更是对能力市场品类体系的建立。它为能力市场的交易和认证奠定了分类学基础。

1.3 法律与商业的双重催化

“数据不动”理念从学术走向产业的背后,是两股强大的催化力量。

法律层面,全球已有超过140个国家颁布了数据主权相关法律[2]。欧盟GDPR确立了数据可移植权[12],2024年生效的欧盟《数据法案》强制要求云服务商保障客户数据的可移植性[13]。中国《数据安全法》确立了数据分类分级制度,核心数据不出境[10];《个人信息保护法》对敏感个人信息的跨境传输设置了严格约束[11]。这些法律的共同指向是:合规底线从“保证数据安全”转变为“证明数据没有离开指定边界”。

商业层面,当AI从“推荐商品”渗透到“评估绩效、优化成本、辅助研发”等核心决策领域时,企业绝不敢将核心数据交给无法掌控的云端模型。同时,企业渴望像搭乐高一样自由组合来自不同厂商的最佳能力而不被任何一家锁定——Gartner将这种理念称为“可组装企业”[14]。

1.4 DISC架构的创新贡献

DISC架构的创新不在于发明了某一项单一技术,而在于以下四个方面。

统一了分散的技术实践——将联邦学习、机密计算、数据虚拟化、Headless BI等各自独立发展的技术,整合在“数据不动,能力流动”的统一架构框架下。

建立了能力的品类体系——将流动的“能力”区分为智能能力、逻辑能力、治理能力三类,为能力市场的交易和认证奠定了分类学基础。

内化了主权治理机制——将“数据主权”从外部法律约束转变为架构的内部属性。主权合规网关的强制拦截、能力血缘追踪的不可篡改日志、TEE远程证明[15]的硬件签名,让“合规”从人的承诺变成了代码的强制。

提供了完整的工程蓝图——通过“5+1”核心组件(能力注册中心、能力编配器、能力执行沙箱、主权合规网关、能力血缘追踪,以及协同总线),为整个行业提供了一套可用现有技术实现的参考架构。

1.5 理论升华:数字时代生产力与生产关系的重新对齐

这场变革的深层意义,是数字时代生产力与生产关系的重新对齐。数据是核心生产要素,AI和分析是核心生产力工具。当数据的所有权——数据主权——被法律和技术双重确权,生产工具——能力胶囊——就必然走向市场化和自由流动。这是数字经济的“生产关系”适应“生产力”的必然演进。

从更宏观的视角看,DISC架构正在重塑数字时代的权力结构。在旧世界中,少数云巨头和大型SaaS厂商如同中世纪的封建领主,占有广阔的“数据土地”。企业如同佃农,将自己的经营数据、客户数据、财务数据上交到领主平台上,换取使用生产工具的权利。数据越多,迁移成本越高,人身依附关系越牢固。

DISC架构开启了一种新的“数据民主”范式。数据的主权回归每一个创造数据的企业。法律确立了数据的产权边界。技术保障了产权的执行——联邦学习让数据在不出域的前提下联合训练,机密计算让云端推理也无法窥视明文,能力血缘追踪提供不可篡改的合规证据。能力胶囊的全球化流通如同商品的自由贸易——任何一家公司,只要拥有卓越的算法,就可以将能力封装为胶囊,销售给全球的企业客户,而无需“拥有”任何客户数据。

这不是垄断的终结,而是垄断形态的转移——从“数据垄断”转向“能力垄断”,而能力垄断是可以通过持续创新来打破的。

二、合规内化:DISC架构的法律基础

2.1 从法律条款到技术架构的转化

DISC架构将数据主权从“合同条款”变成了“架构属性”。数据面部署在数据所有者的司法辖区内,控制面的每一道指令都必须经过主权合规网关的验证。不符合数据驻留要求的任务根本无法被调度执行。

主权合规网关——数据流动的“海关闸口”

法律要求“数据未经授权不得出域”。在传统模式下,这个要求转化为合同条款——“厂商承诺不会将数据传输到授权范围之外的地区”。但承诺的验证方式是“相信”。在DISC模式下,这个要求转化为架构的默认属性:所有能力胶囊在进入数据辖区之前必须出示“能力护照”——包含能力身份标识、数据访问声明、安全审计证明、平台认证徽章。网关验证签名和权限,签发临时准入令牌。不符合要求的能力根本无法被调度执行。法律要求从“人的审批”变成了“代码的强制”。

能力血缘追踪——每一次处理的“黑匣子”

法律要求“数据处理活动应当有记录”。在传统模式下,这个要求转化为操作日志——分散在各系统中,格式不统一,容易被篡改或丢失。在DISC模式下,能力血缘追踪自动记录能力胶囊的全生命周期行为。日志不可篡改——每条日志的哈希值包含前一条日志的哈希,任何篡改都会导致哈希链断裂。审计师可以独立验证日志的完整性和真实性。

TEE远程证明——代码完整性的“硬件自证”

法律要求“数据处理环境应当安全可靠”。在传统模式下,这个要求转化为安全白皮书和渗透测试报告。在DISC模式下,能力执行沙箱可启用TEE增强模式。飞地生成由CPU硬件密钥签名的远程证明报告[15],向远端的验证者证明飞地内运行的代码与预期版本一致、未被篡改。信任的根从“人的承诺”转移到了“硅的物理定律”。

数据清空可验证——删除义务的“技术闭环”

法律要求“数据使用完毕后应当删除”。在DISC模式下,会话结束后沙箱销毁,加密内存回收,临时文件安全擦除,密钥丢弃。销毁操作生成不可篡改的日志条目。审计师可以在测试环境中模拟完整的数据处理流程,使用磁盘取证工具尝试恢复数据,验证数据已不可恢复。

2.2 主要法律条款的DISC映射

法律条款法律要求DISC架构中的技术实现
GDPR第5条“数据最小化”[12]个人数据应充分、相关、限于处理目的所必需能力胶囊必须在能力注册中心声明数据访问清单(精确到表和字段);能力执行沙箱根据声明自动生成最小权限策略,禁止访问未声明的数据
GDPR第17条“被遗忘权”[12]数据主体有权要求删除其个人数据治理能力胶囊自动扫描所有数据面中包含该数据主体标识的数据,执行删除或匿名化操作,生成完整的删除审计报告
GDPR第20条“数据可携权”[12]数据主体有权获取其个人数据并转移给其他控制者数据始终在客户本地数据面中,以标准化格式存储,可随时通过标准接口导出,无需厂商配合
GDPR第28条“委托处理”[12]受托处理者必须按照控制者的书面指示处理数据主权合规网关执行“使用策略”:能力胶囊只能在声明的目的范围内处理数据,超出范围的访问被网关自动拦截
《数据安全法》第21条“数据分类分级”[10]国家建立数据分类分级保护制度分类分级标签随数据生命周期动态附着;治理能力胶囊在每次数据访问时自动检查数据等级并应用对应安全策略
《数据安全法》第31条及相关办法“数据出境安全评估”[10]重要数据出境需经过安全评估能力编配器在调度时自动排除境外数据面节点;主权合规网关拦截任何未经审批的跨境能力流
《个人信息保护法》第13条“告知-同意”[11]处理个人信息需取得个人同意能力胶囊的数据访问声明中需包含处理目的和法律依据;当处理目的变更时需重新授权

三、问题背景:旧地图的失灵

3.1 传统架构的三种模式及其局限

过去三十年,企业数字化经历了三种主流架构模式,它们各自解决了当时的关键问题,但都共享一个从未被质疑的前提:应用、逻辑和数据必须物理上待在一起。

巨型单体ERP时代解决了“信息孤岛”问题,但代价是僵化、昂贵、升级如同开胸手术。数据锁在保险柜里,但企业自己也用不好。

公有云SaaS时代解决了“敏捷与免运维”问题,但代价是数据的物理控制权交出。数据存在厂商的服务器上,受厂商所在国法律管辖。迁移成本高昂,格式不兼容,法务上永远悬着一根刺。

私有化与混合云部署看似折中,实则两头不靠。保留了本地运维的负担,又失去了SaaS持续创新的能力。软件版本老化,能力停滞。

3.2 三股力量撕碎旧契约

数据主权的法律刚性化:GDPR确立数据可移植权[12],欧盟《数据法案》强制要求云服务商支持平滑迁移[13]。中国《数据安全法》《个人信息保护法》确立分类分级制度[10][11],核心数据不出境。合规底线从“保证数据安全”变成“证明数据没有离开指定边界”。

AI向决策核心渗透带来的信任鸿沟:当AI从“推荐商品”进入“评估绩效、优化成本、辅助研发”时,企业绝不敢将核心数据交给无法掌控的云端模型。法务和安全负责人在AI采购中的否决权越来越大。

可组装企业理念对敏捷的重新定义:企业需要像搭乐高一样从不同供应商自由组合能力,所有能力在统一数据基座上工作,而不被任何一家锁定[14]。

3.3 不可能三角

CEO要敏捷,CFO要降本,法务要合规。在传统架构下,这是一个不可能三角——要敏捷就要上云,上云就难合规;要合规就要本地化,本地化就贵且僵化。企业数字化亟需一张新地图。

四、DISC架构概述

4.1 定义

DISC(Data In-situ Sovereign Capability Architecture,数据原位主权能力架构)是一种将“能力”与“数据”彻底解耦的新一代企业数字化架构范式。它的核心原则是控制面与数据面彻底分离

4.2 命名立意

Data(数据):数据是架构围绕的太阳,一切设计决策的起点是数据主权的不可侵犯性。

In-situ(原位):数据必须保持在它被创建、被存储、被授权的精确物理和法律位置。In-situ超越了Local(本地)和On-Premise(私有化部署),是对数据驻留最严格的表达。

Sovereign(主权):将数据主权从合同条款变成架构属性。数据面部署在数据所有者的司法辖区内,不符合数据驻留要求的任务根本无法被调度执行。

Capability(能力):流动的不是抽象的“计算”,而是具体的“能力”——智能能力(AI模型)、逻辑能力(业务规则)、治理能力(合规策略)。

发音隐喻:DISC发音同“Disk”(磁盘)。在传统硬盘中,盘片是数据的物理载体,磁头是计算的发生器。磁头移动,数据不动。这正是DISC架构的完美隐喻。

4.3 架构总览

DISC架构由横向切分和纵向流动构成骨架。

横向切分:控制面运行在云端,负责管理与编排——能力注册、版本发布、许可证管理、计费结算——但不接触业务数据。数据面沉淀在企业本地,承载核心数据资产,提供标准化数据访问接口,执行数据安全策略,运行能力胶囊。

纵向流动:能力胶囊从云端能力市场下载到企业本地,在隔离沙箱中运行,处理本地数据,产出结果。版本更新通过控制面静默推送,数据始终留在原地。

4.4 两种运行模式

模式一:推理即服务。 能力留在云端,企业只传输计算必需的特征向量或查询语句。云端在隔离环境(TEE机密计算飞地)中执行计算,返回结果后立即清空所有临时数据。适用于高频更新、合规允许加密特征临时出域的场景。

模式二:能力即资产。 能力被封装为加密胶囊,从能力市场下载到企业本地环境运行。所有计算在防火墙内完成,数据完全不出企业边界。适用于数据高度敏感、要求低延迟、需要完全离线运行的场景。

五、核心原则

DISC架构遵循五项黄金原则:

原则一:数据最小出域。 能不下云就不下云。如果必须调用外部能力,只传输计算必需的中间结果,默认用完即删。

原则二:默认不信任。 每个能力胶囊在被证明无害之前都被视为不可信。运行时默认禁止所有出站网络连接,数据接口必须显式声明和审批授权。

原则三:可证明的隐私。 安全不靠承诺,而靠密码学(加密证明)、硬件飞地(远程证明)和审计日志(不可篡改)来自证清白。客户可以随时验证厂商的声明。

原则四:离线可用。 核心业务能力在断开云端连接后必须能继续独立运行。不能因厂商故障导致停产。

原则五:能力持续迭代。 软件价值载体不再是许可证版本,而是持续更新的算法和规则。更新通过控制面推送,但永远不干扰本地数据主权。

六、能力三元论

DISC架构中流动的“能力”不是笼统概念,而是三类可识别、可设计、可交付的“能力体”:

6.1 智能能力

从数据中学习模式的能力。包括大语言模型权重、联邦学习参数、推理脚本、特征工程流水线。以加密容器镜像形式流动,按调用次数或节点数计费。核心问题是“模型如何安全进来,精调后如何带走”。

6.2 逻辑能力

在数据上执行判断的能力。包括业务规则引擎、决策树、风控策略集、薪酬核算规则。以版本化的策略代码包形式流动,按员工数或业务量计费。核心问题是“规则如何下沉到交易发生地实时执行”。

6.3 治理能力

守护数据底线的能力。包括数据脱敏算法、访问控制策略即代码、合规审计脚本。以动态注入的策略插件形式流动,按审计频率或数据源数量计费。核心问题是“合规要求如何随数据生命周期动态附着”。

6.4 能力品类的商业意义

三类能力的划分不仅是技术分类,更是商业品类的建立。不同品类的能力有不同的交付形态、安全要求、计费模式和认证标准。这为能力市场的繁荣奠定了分类学基础。

七、核心组件:5+1能力编配体系

DISC架构由五大核心组件和一条协同总线构成:

7.1 能力注册中心

能力的“地图”与“App Store”。存储每个能力的元数据——名称、类型、版本、数据访问声明、依赖关系、认证状态、客户评价。企业在此搜索、比较、订阅能力。ISV在此发布、更新、管理能力。注册中心只存储元数据,不存储能力包本身,不接触业务数据。

7.2 能力编配器

智能决策的“调度中枢”。根据数据位置、主权约束、SLA要求和网络代价,决定将何种能力以何种形态分发到何处的数据面执行。典型决策场景:能力需要访问“华东区客户数据”,编配器查询数据面元数据,发现数据只存在于上海数据中心,受中国法律管辖,排除海外节点,选择最优沙箱作为目标。

7.3 能力执行沙箱

本地安全的“计算环境”。提供从网络、文件系统、系统调用到硬件内存的全方位隔离。默认禁止出站网络连接,文件系统只读,系统调用白名单过滤。可选启用TEE增强模式,在硬件加密内存中执行推理。沙箱安全策略从能力的“数据访问声明”中自动生成,实现默认不信任的自动化执行。

7.4 主权合规网关

边界的“强制拦截器”。在能力流和数据流跨越关键边界时进行强制拦截和验证。验证能力身份和厂商签名,验证数据访问边界声明,可选启用“防水堡”技术对输出结果进行合规审查,确保不包含原始数据片段。

7.5 能力血缘追踪

不可篡改的“审计证据链”。记录能力从注册到销毁的全生命周期轨迹——谁的能力、在何时、触达了哪些数据、产生了什么结果。基于防篡改日志或区块链技术存储,为合规审计提供完整证据链。

7.6 协同总线

贯穿始终的“连接组织”。五大组件通过事件驱动的异步消息总线协同工作。能力注册中心的元数据变更通知编配器,编配器的调度决策通知沙箱和网关,沙箱的执行状态上报血缘追踪。

八、技术基石

8.1 联邦学习与隐私计算

实现智能能力在多个数据面之间安全流动和联合成长的核心技术。横向联邦(不同样本相同特征)、纵向联邦(相同样本不同特征)、联邦迁移学习(样本特征均少重叠)三种范式覆盖不同场景[6]。安全机制包括梯度同态加密[16]、差分隐私噪声注入[17]、安全聚合协议。已在金融跨机构反欺诈[18]、医疗多中心联合影像诊断[19]等场景大规模验证。

8.2 机密计算与完全同态加密

能力执行沙箱的硬件与数学双重安全保障。机密计算(TEE)利用CPU内置加密引擎创建硬件隔离飞地,能力在飞地内执行,云厂商管理员无法窥视。完全同态加密(FHE)允许在密文上直接计算,全程不暴露明文[16]。两者互补:TEE性能高但依赖特定硬件,FHE纯数学保证但性能较低。

8.3 数据虚拟化与数据编织

DISC数据面的核心基础设施。数据虚拟化在物理数据源之上建立统一语义层,能力胶囊通过标准接口查询,引擎自动将查询下推到各数据源执行,数据从不移动。数据编织利用AI和主动元数据自动发现、编目和治理分散数据,让数据虚拟化层持续自我进化[20]。

8.4 MLOps与能力胶囊化

能力的标准化封装、交付与持续演进体系。MLflow[21]和ONNX[22]定义模型打包标准,BentoML实现容器化封装。NVIDIA Triton[23]和ONNX Runtime[22]提供本地推理引擎。Seldon Deploy[24]和OctoML[25]提供远程管理控制面。CI/CD流水线实现从训练到打包到安全扫描到金丝雀发布到漂移检测的完整闭环。

九、行业实践

9.1 金融行业

微众银行FATE框架[26]与中国银联联合数十家银行,采用纵向联邦学习构建跨机构反欺诈模型。联合模型AUC显著提升,全程数据未出各银行私有云边界。该实践被纳入IEEE 3652.1-2020联邦学习国际标准[27]。

星展银行与Partisia合作,采用安全多方计算完成全球首笔基于MPC的ESG绿色信贷审核。船运公司、港口、第三方核查机构的碳排放数据在MPC集群中以密文形式完成核算,只向银行输出“合格”或“不合格”的结果,各方原始数据完全隔离。

9.2 医疗行业

NVIDIA FLARE[19]与联影智能在多家庭院部署联邦学习,联合训练肺炎CT筛查AI模型。诊断准确率逼近“集中训练”黄金标准,所有患者影像数据从未离开医院机房。Rhino Health构建跨国罕见病研究联邦网络[28],解决单一中心病例太少无法训练有效模型的困境。

9.3 制造业

西门子Industrial Edge[29]将AI能力打包为边缘胶囊,在工厂车间本地处理高频传感器数据,只上传聚合KPI。宝马Catena-X汽车数据空间[30]基于IDS标准[31]构建去中心化供应链数据交换生态,碳足迹计算在供应商本地完成,只共享计算结果。

9.4 数据要素市场

奇安信数据交易沙箱实践“数据可用不可见”范式,数据买家带着算法进入数据卖家的沙箱执行计算,原始数据不出卖家的安全边界。已产生显著经济效益。

9.5 政务与科研

鹏城实验室依托“中国算力网”国家级基础设施[8],在多语言翻译、基因数据安全开放、政务数据融合等场景中验证了“数据不动程序动”架构,入选行业年度重大科技进展。微软可信研究环境(TRE)[32]允许研究人员在高安全控制下访问敏感数据进行分析,数据本身不离开安全环境。

十、商业模式

10.1 四大收入引擎

订阅制授权(核心收入,占比50-60%):收费标的是“能力持续更新权”。智能能力按调用量或节点数计费,逻辑能力按员工数或业务量计费,治理能力按数据源数量或审计频率计费。

信任溢价(高利润收入,占比15-20%):为“可证明的安全”付费。对于金融、医疗、军工等行业,合规不是加分项,而是生存底线。产品包括数据清空审计报告、TEE远程证明验证服务、高保障SLA、责任共担保险。

增值服务(客户粘性,占比15-20%):模型持续迭代升级订阅、基于客户本地数据的微调定制服务、工具链授权、实施与培训。

生态佣金(平台型收入,占比20-30%):第三方胶囊交易抽成、认证与测试费、流量与推广费。

10.2 新旧模式对比

旧模式价值载体是“系统”,卖的是软件许可加数据托管,续费动力来自“不敢换”。新模式价值载体是“能力胶囊”,卖的是持续更新的算法和规则,续费动力来自“不想换”。旧模式边际成本显著,新模式边际成本趋近于零。

十一、DISC架构的产业生态演进

11.1 生态演进的四个阶段[1]

第一阶段:技术萌芽期(2016-2025)。 以联邦学习、机密计算等隐私增强技术的独立发展为主,各技术之间缺乏统一架构整合。代表事件包括2016年谷歌提出联邦学习[5]、2022年方滨兴院士提出“数据不动程序动”[7]、2024年欧盟《人工智能法》为“数据不动”类技术提供法律背书[9]。

第二阶段:架构成型期(2026-2027)。 DISC架构正式提出,完成从“程序”到“能力”的概念升维,建立“5+1”核心组件体系和能力三元论。代表事件是2026年DataSov社区发布DISC架构白皮书,首批能力市场开始试运行。

第三阶段:生态构建期(2027-2029)。 能力市场开始规模化运转,行业数据空间逐步建立,标准业务对象模型在行业层面形成共识。平台厂商完成从“应用开发商”到“能力市场运营商”的战略转型。预计首批行业数据空间(汽车、医疗、金融)实现商业化运营。

第四阶段:生态成熟期(2030及以后)。 能力市场全球化,跨行业数据空间互联互通。自主能力流开始出现——具备AI Agent特性的能力体自主穿梭于各主权域之间。数据主权成为数字基础设施的默认配置。

11.2 生态参与者的角色分化

基座运营商提供本地数据基座和控制面,作为联邦的基础设施提供商。能力胶囊商聚焦垂直场景,交付极致的算法和逻辑,作为联邦的专业服务商。信任服务商提供独立审计、安全评测和合规保险,作为联邦的司法与保险体系。平台厂商运营能力市场,从交易中抽取佣金,作为联邦的商业基础设施运营者。

十二、实施路线图[1]

12.1 企业CIO三年路线图

第1年:奠基。 完成数据资产盘点,选择速赢场景用能力胶囊跑通首个闭环,启动本地数据基座建设。

第2年:扩展。 引入3-5个能力胶囊覆盖更多场景,建立能力评估委员会,启动绞杀者模式[33]替换第一个老模块。

第3年:成熟。 核心系统胶囊化,完善合规审计体系,参与行业数据空间实现跨企业数据协作。

12.2 平台厂商三年路线图

第1年:定标准、建控制面。 提炼并开源标准业务对象模型,成立独立专项团队,构建控制面MVP,开发首批官方核心胶囊。

第2年:拉伙伴、建生态。 启动生态伙伴计划,建立胶囊认证体系,为存量客户提供外挂式基座。

第3年:做市商、定规则。 运营繁荣的能力市场,主导行业标准制定,探索产业资本运作。

12.3 创业者三年路线图

第1年:生存。 选定垂直场景,开发最小可行胶囊,找到设计伙伴标杆客户,获取安全审计报告。

第2年:成长。 产品化打磨,扩展5-10家付费客户,入驻主流平台能力市场。

第3年:领先。 建立行业数据接口适配壁垒,拓展增值服务,探索海外市场。

十三、DISC架构的挑战与局限性

13.1 技术挑战

能力市场冷启动困境。 能力市场是典型的双边市场——ISV不愿意入驻因为没有企业客户,企业不愿意来因为没有ISV。需要平台厂商率先投入核心胶囊开发和生态激励,突破“鸡生蛋蛋生鸡”的冷启动瓶颈。

联邦查询性能差距。 联邦查询的性能与本地查询之间仍存在差距,特别是在跨多个异构数据源的复杂关联查询场景中。查询下推策略的优化、预聚合缓存的设计、网络延迟的补偿是持续的技术挑战。

隐私增强技术成熟度参差不齐。 联邦学习已在金融和医疗领域大规模部署,技术成熟度达到五颗星。但完全同态加密仍有性能瓶颈,适用于轻量模型,对于千亿参数的大语言模型全FHE推理仍需突破。

13.2 商业挑战

传统软件厂商的转型阻力。 那些依赖数据锁定赚钱的厂商不会主动拥抱变革。他们可能通过专利诉讼、标准绑架、政策游说等手段延缓DISC架构的推广。

企业客户的决策惯性。 从“买系统”到“订阅能力”的转变需要市场教育。企业IT部门的预算结构、采购流程、考核指标都建立在“系统采购”模式之上,改变这些需要时间。

13.3 法律与监管挑战

各国数据主权法律的不一致性。 欧盟GDPR[12]、中国《数据安全法》[10]、美国各州隐私法案各有不同要求,可能导致数据空间的碎片化——不同司法辖区的数据空间采用不同的标准,跨辖区互操作面临法律障碍。

自主能力体的法律责任认定。 当一个AI Agent自主决策导致损失时,谁是责任主体?是能力体的开发者、激活能力体的企业、还是能力体的运营平台?目前的法律框架尚未覆盖这一场景。

13.4 组织与文化挑战

企业IT部门的技能转型需要时间和投入。数据所有者意识的建立需要持续的文化培育。联邦式组织的治理机制需要在实践中不断磨合。

十四、DISC架构的未来演进

14.1 从被动调度到自主能力流

当前DISC架构的能力流动是“被动调度”——能力编配器根据预设规则决定能力的分发路径。未来,具备AI Agent特性的“能力体”将不再被动等待调度,而是主动嗅探数据位置、自主协商执行环境、带着任务穿梭于各主权域之间,完成任务后自动销毁。能力编配器从“中央调度中枢”演变为“策略治理中心”——定义能力体的行为边界,发布全局优化目标,监控异常行为。

14.2 从企业数据空间到全球数据联邦

当前行业数据空间以行业为边界。未来,跨行业数据空间将互联互通,形成全社会范围的数据联邦。能力胶囊可以在不同行业的数据空间之间自由流动,数据主权始终得到保护。跨国企业可以通过统一的全球控制面,管理分布在各国的本地数据面。能力胶囊在不同国家的数据面之间安全流动,但每一国的核心数据都留在本国境内。

14.3 从人工治理到自主治理

当前DISC-DAMA实现了治理规则的代码化——治理能力胶囊在云端定义、在本地自动执行。未来,AI Agent将介入治理——自主嗅探数据环境变化、自主调整治理策略、自主生成合规报告。人的角色从“立法者”升级为“监督者”——监督Agent的决策是否合理,在Agent无法决策的复杂伦理问题上做出最终判断。

14.4 DISC架构与新兴技术的融合

DISC与Web3:去中心化身份认证(DID)与能力护照的结合,可以实现更高效、更去中心化的能力身份管理。智能合约与能力经营权交易的结合,可以实现自动化的能力计费和结算。

DISC与后量子密码学:量子计算可能颠覆当前的加密体系。DISC架构需要提前布局后量子密码学,确保在量子计算时代数据主权仍然得到保障。

DISC与数字孪生:在数据不出域的前提下,通过能力胶囊在各数据面本地运行仿真模型,实现跨企业的联合数字孪生——供应链数字孪生、城市数字孪生、工业设备数字孪生。

术语表

术语定义
DISCData In-situ Sovereign Capability Architecture,数据原位主权能力架构
能力胶囊自包含、可安全分发、能在隔离环境中运行、拥有明确数据访问接口的标准化软件包
控制面运行在云端的管理层,负责能力注册、编配、授权、计费,不接触业务数据
数据面沉淀在企业的数据基础设施,承载核心数据资产,执行数据安全策略,运行能力胶囊
智能能力从数据中学习模式的能力体,如AI模型、联邦学习参数
逻辑能力在数据上执行判断的能力体,如业务规则引擎、决策树
治理能力守护数据底线的能力体,如数据脱敏算法、合规审计脚本
能力注册中心存储能力元数据的中心目录,提供搜索、比较、订阅功能
能力编配器根据主权约束和SLA智能决策能力分发路径的调度中枢
能力执行沙箱能力胶囊的本地安全运行环境,提供网络、文件系统、系统调用全方位隔离
主权合规网关部署在数据辖区边界的强制拦截器,验证能力身份和使用策略
能力血缘追踪记录能力全生命周期行为的不可篡改审计日志系统
协同总线贯穿五大组件的异步消息中枢,实现事件驱动的跨组件协同
TEE可信执行环境(Trusted Execution Environment),CPU内部的硬件加密飞地
FHE完全同态加密(Fully Homomorphic Encryption),允许在密文上直接计算的密码学技术
IDS国际数据空间(International Data Spaces),去中心化数据交换生态系统的标准架构[31]
绞杀者模式渐进式系统替换策略(Strangler Fig Pattern)[33],新能力逐步替换旧模块,最终“绞杀”旧系统

DataSov社区[1]

数据是根,能力是叶。根深扎于地,叶自由向阳。

引用内容注释与来源说明

[1] DataSov社区与场景描述:“DataSov社区”及“DISC架构研究组”为本白皮书虚构的发布机构与作者组。文中“生态演进的四个阶段”为基于DISC架构理念的前瞻性预测,其中各阶段的时间划分及标志性事件(如首批能力市场试运行)均为展望性描述。文中“企业CIO三年路线图”、“平台厂商三年路线图”、“创业者三年路线图”亦为规划性建议框架,其中涉及的具体数字和步骤均为创作。

[2] 全球超过140个国家颁布数据主权相关法律:数据来源于联合国贸易和发展会议(UNCTAD)的全球数据保护与隐私立法追踪。截至2021年底已有137个国家制定类似法律,近年来持续增长,“超过140国”为合理估算。UNCTAD统计页面:Data protection and privacy legislation worldwide | UN Trade and Development (UNCTAD)

[3] 隐私保护数据挖掘(PPDM):隐私保护数据挖掘作为一个正式确立的研究领域,其奠基性工作公认始于2000年Agrawal & Srikant和Lindell & Pinkas的两篇开创性论文。此处为泛指该领域的早期探索阶段。代表文献:Agrawal, R., & Srikant, R. (2000). Privacy-preserving data mining. ACM SIGMOD 2000https://doi.org/10.1145/342009.335438

[4] 姚期智“百万富翁问题”与安全多方计算:姚期智院士在1982年通过提出“百万富翁问题”奠定了安全多方计算的理论基础。Yao, A. C. (1982). Protocols for secure computations. *23rd SFCS 1982*, 160-164. https://doi.org/10.1109/SFCS.1982.38

[5] 谷歌联邦学习:谷歌于2016年提出联邦学习概念,2017年发表核心论文。McMahan, B., et al. (2017). Communication-efficient learning of deep networks from decentralized data. AISTATS 2017[1602.05629] Communication-Efficient Learning of Deep Networks from Decentralized Data

[6] 联邦学习三种范式:杨强教授团队于2019年系统总结并命名了横向联邦学习、纵向联邦学习与联邦迁移学习三种范式。Yang, Q., Liu, Y., Chen, T., & Tong, Y. (2019). Federated machine learning: Concept and applications. ACM TIST, 10(2), 1-19. https://doi.org/10.1145/3298981

[7] 方滨兴院士“数据不动程序动”:2022年,方滨兴院士在BCS大会(北京网络安全大会)上正式提出“数据不动程序动”理念及相关工程架构。相关报道可参见中国电子报等行业媒体对方滨兴院士演讲的报道。

[8] 鹏城实验室与“中国算力网”:鹏城实验室牵头建设“中国算力网”。在“数据不动程序动”架构下开展AI靶场等应用验证,相关成果入选行业年度重大科技进展。官网:鹏城实验室

[9] 欧盟《人工智能法》:Regulation (EU) 2024/1689。该法鼓励使用隐私增强技术(PETs)来平衡数据保护与AI创新。法律文本:Regulation - EU - 2024/1689 - EN - EUR-Lex

[10] 中国《数据安全法》:2021年9月1日起施行。第21条确立分类分级制度;第31条规定重要数据出境安全评估。法律全文:中国人大网

[11] 中国《个人信息保护法》:2021年11月1日起施行。第13条规定告知-同意规则;第38-40条规定个人信息出境条件。法律全文:中国人大网

[12] GDPR:欧盟《通用数据保护条例》(Regulation 2016/679)。法律原文:General Data Protection Regulation (GDPR) – Legal Text

[13] 欧盟《数据法案》:Regulation (EU) 2023/2854,于2024年1月11日生效,主要义务自2025年9月12日起适用。法律文本:Regulation - EU - 2023/2854 - EN - Data Act - EUR-Lex

[14] Gartner“可组装企业”:Gartner提出的战略技术趋势,指企业通过组合打包的业务能力(PBC)来构建应用。参见Gartner相关报告:https://www.gartner.com/en/documents/4000000

[15] TEE远程证明:可信执行环境的核心安全机制,允许远程方验证飞地中运行的代码完整性。相关标准化工作参考IETF RATS工作组:Remote ATtestation ProcedureS (rats)

[16] 同态加密:Gentry, C. (2009). Fully homomorphic encryption using ideal lattices. STOC 2009https://doi.org/10.1145/1536414.1536440

[17] 差分隐私:Dwork, C. (2006). Differential privacy. ICALP 2006Differential Privacy | Springer Nature Link

[18] 微众银行FATE与中国银联案例:微众银行FATE框架与中国银联合作构建跨机构反欺诈模型。FATE官网:https://fate.fedai.org/

[19] NVIDIA FLARE:NVIDIA开源的联邦学习平台,支持医疗影像等场景。官网:NVIDIA FLARE | NVIDIA Developer

[20] 数据编织:Data Fabric,Gartner提出的数据管理架构理念。参见Gartner Glossary:https://www.gartner.com/en/information-technology/glossary/data-fabric

[21] MLflow:Databricks开源的机器学习生命周期管理平台。官网:MLflow - Open Source AI Platform for Agents, LLMs & Models

[22] ONNX与ONNX Runtime:开放神经网络交换格式及运行时。官网:ONNX | Home ;ONNX Runtime | Home

[23] NVIDIA Triton:NVIDIA开源的企业级推理服务器。官网:https://developer.nvidia.com/triton-inference-server

[24] Seldon Core/Deploy:开源的Kubernetes原生模型服务框架及其企业级管理控制面。官网:https://www.seldon.io/

[25] OctoML:专注于ML模型自动优化和部署的平台。官网:https://octoml.ai/

[26] FATE框架:FATE(Federated AI Technology Enabler)已捐赠给Linux基金会。官网:https://fate.fedai.org/

[27] IEEE 3652.1-2020:联邦学习参考架构国际标准。标准信息:https://standards.ieee.org/ieee/3652.1/10325/

[28] Rhino Health:全球性医疗AI联邦学习平台。官网:Rhino Federated Computing | Federated AI | Data Layer

[29] 西门子Industrial Edge:西门子工业边缘计算平台。官网:https://www.siemens.com/global/en/products/automation/topic-areas/industrial-edge.html

[30] Catena-X:面向汽车行业的开放数据生态系统。官网:Home - Catena-X

[31] 国际数据空间(IDS):International Data Spaces,由IDSA提出的参考架构。官网:https://internationaldataspaces.org/

[32] 微软可信研究环境(TRE):Azure受信任的研究环境。参见:https://learn.microsoft.com/en-us/azure/architecture/example-scenario/data/trusted-research-environment

[33] 绞杀者模式:Strangler Fig Pattern,由Martin Fowler于2004年提出的软件现代化迁移策略。参见:Strangler Fig

...全文
369 回复 打赏 收藏 转发到动态 举报
写回复
用AI写文章
回复
切换为时间正序
请发表友善的回复…
发表回复

1

社区成员

发帖
与我相关
我的任务
社区描述
聚焦“控制面与数据面彻底分离”的数据主权架构。探讨本地数据基座、能力胶囊与隐私计算如何让企业兼得敏捷与合规。汇聚架构师与创业者,共筑数据主权新生态。
系统架构 个人社区
社区管理员
  • 土拨鼠烧电路
加入社区
  • 近7日
  • 近30日
  • 至今
社区公告
暂无公告

试试用AI创作助手写篇文章吧