
如果把一家人工智能公司的招股说明书从头读到尾线上炒股融资平台,会发现一个很有意思的现象。

在传统软件企业中,投资者通常首先关注产品、客户、收入和知识产权;但到了大模型时代,还有一个越来越难绕开的基础问题: 模型所依赖的数据,到底从哪里来? 这个问题已经不只是技术团队内部的数据工程问题。
2026年6月17日,上交所发布《上海证券交易所发行上市审核规则适用指引第10号——人工智能大模型企业适用科创板第五套上市标准》。在判断企业是否具有明显技术优势时,“数据获取和治理能力”被明确列入需要论证和披露的维度;同时,大模型业务或产品还应符合数据安全与隐私保护、知识产权保护等相关规定。中国证券指数公司
这释放出一个值得关注的信号: 对于AI企业,数据正在同时具有“技术资产”和“合规对象”两种属性。 企业拥有多少数据当然重要。
但对于准备进入资本市场的AI企业,更重要的问题可能是:这些数据从哪里取得、依据什么权利使用、经过哪些处理、最终进入了什么模型,以及企业能不能把这条链条解释清楚。
01|核心判断:AI公司的数据能力,正在进入IPO审查视野过去评价一家AI企业的技术能力,人们很容易把注意力集中在模型参数、算法、研发人员、专利数量和算力资源上。
大模型改变了这个评价体系。
因为模型能力并不是凭空产生的。
至少从工程角度看,一套模型能力背后通常存在几类基础资源: 算法、算力、数据和工程体系。 其中,数据又是最特殊的一项。
GPU可以买,云算力可以租,开源框架可以使用,算法人才可以招聘,但一家企业长期积累的数据资源,往往与它的业务场景、客户、产品、采集渠道和数据治理能力深度绑定。
2026年上交所针对人工智能大模型企业的最新审核指引已经明确要求,发行人结合模型技术先进性、多模态和智能体等技术突破、持续研发和技术迭代能力以及数据获取和治理能力等方面,合理审慎论证并披露同行业领先的技术优势。中国证券指数公司
这里有两个词值得放在一起看: 数据获取 + 数据治理。 前者回答“数据从哪里来”。
后者回答“数据来了以后怎么管”。
这意味着,数据多并不天然等于数据能力强。
真正能够形成企业竞争能力的数据,应当至少同时满足几个条件: 能够持续取得、能够实际使用、质量满足需要、权利边界相对清晰,并且能够被有效治理。 进一步看,AI企业的数据问题已经出现了一个很明显的变化: 数据来源问题正在从后台的技术问题,逐渐变成需要被解释、被核查、被证明的企业治理问题。 02|先看一家真实AI数据公司的招股说明书为了避免把这篇文章写成泛泛的数据合规讨论,可以先看一个真实案例。
北京海天瑞声科技股份有限公司于2021年在科创板上市。它并不是今天意义上的通用大模型厂商,其核心业务是为人工智能产业提供训练数据相关服务,因此特别适合观察“AI训练数据是怎样被生产出来的”。
海天瑞声在IPO披露材料中,对训练数据生产过程进行了相当具体的描述。
其基本业务过程并不是简单的“从网上找数据,然后卖给AI公司”,而是通过设计、采集、加工、质检等工序,将原料数据生产为可以用于算法模型训练的数据集。其披露材料列举的原料数据包括声音、文本、图像、视频等。上交所静态网站
以自然语言数据为例,其招股材料披露的处理活动包括文本清洗、分词、词性标注、实体标注、句法分析、情感属性标注等,最终形成原始数据文件、标注文件和技术文档等训练数据成果。中国证券指数公司
如果把这些披露转换成一条技术链,大致可以理解为: 业务需求 → 数据集设计 → 原料数据采集 → 数据清洗 → 数据加工/标注 → 质量检查 → 训练数据集 → 模型训练 这条链非常重要。
因为它说明: AI训练数据并不是一个静态文件,而是一项持续发生的数据生产活动。 而只要把这条生产链再向前、向后各延伸一步,合规问题就出来了。
向前,要问: 原料数据从哪里来? 向后,要问: 生产出来的数据集最终允许被怎样使用? 03|“数据从哪里来”,至少要拆成不同来源现实中的AI训练数据,不会只有一种来源。
一家AI企业可能同时使用公开互联网数据、自主采集数据、第三方采购或授权数据、合作方提供的数据、客户业务数据、用户使用产品产生的数据,以及经过人工加工或者机器生成的数据。
这些数据最后都可能进入一个训练数据池。
但从法律关系上看,它们并不是同一种数据。
例如:
公开互联网数据 ─────┐
自主采集数据 ───────┤
第三方采购数据 ─────┤
合作方提供数据 ─────┼→ 数据清洗 → 标注 → 数据集 → 模型训练
客户业务数据 ───────┤
用户交互数据 ───────┤
合成数据 ──────────┘
技术人员看到的是:
Dataset。
法务看到的则应该是: 不同权利来源的数据集合。 这是理解训练数据合规最关键的一步。
因为“进入了同一个训练集”,并不会消灭这些数据原来的权利属性。
如果其中存在个人信息,就需要处理个人信息相关问题。
如果其中包含受著作权保护的内容,就会产生知识产权问题。
如果来自客户项目,还可能涉及商业秘密和合同约定。
如果来源于第三方数据供应商,则需要继续核验供应商到底取得了什么权利,以及它有权向AI企业授予什么权利。
因此: 训练数据合规不能只管理Dataset,还必须能够追溯Dataset背后的Source。 04|公开可访问,不等于当然可以用于模型训练互联网是大规模训练数据的重要来源之一,也是最容易被简单化理解的一类数据来源。
一个网页任何人都可以打开,并不意味着围绕网页内容的一切后续利用都当然没有法律边界。
至少需要把几个行为区分开: 访问 → 自动采集 → 复制 → 建立数据集 → 模型训练 → 商业化使用 这是不同层面的行为。
特别是在大规模自动采集场景下,还可能同时涉及网站服务协议、著作权、个人信息、反不正当竞争以及网络数据安全等问题。
《网络数据安全管理条例》第十八条明确规定,网络数据处理者使用自动化工具访问、收集网络数据,应当评估对网络服务带来的影响,不得非法侵入他人网络,不得干扰网络服务正常运行。该条例还专门要求,提供生成式人工智能服务的网络数据处理者加强对训练数据和训练数据处理活动的安全管理。国家市场监督管理总局
如果企业属于《生成式人工智能服务管理暂行办法》所规范的生成式人工智能服务提供者,规则更加直接:提供者依法开展预训练、优化训练等训练数据处理活动时,应当使用具有合法来源的数据和基础模型;涉及知识产权的,不得侵害他人依法享有的知识产权;涉及个人信息的,应取得个人同意或者符合法律、行政法规规定的其他情形。国家市场监督管理总局
所以,从招股说明书研究一家AI企业时,如果看到:
“公司拥有海量公开数据。”
真正值得继续追问的不是“海量是多少”。
而是: “公开”描述的是数据的可访问状态,还是企业已经对后续采集、复制、加工和训练建立了相应的权利与合规基础? 这两件事不能直接画等号。
05|“购买数据”也不等于自动获得模型训练权另一种看起来更安全的数据来源,是购买。
企业可能与数据供应商签订合同:
数据是采购的,所以不存在问题。
但从合同角度继续往下看,事情没有这么简单。
企业取得一批数据以后,至少存在几种完全不同的使用方式: 内部查看、复制、加工、形成衍生数据集、用于模型训练、用于商业模型、向客户提供模型能力。 这些行为的权利基础未必完全相同。
真正需要检查的是: 供应商有权提供什么,企业又被允许使用到什么程度。 这也是为什么AI企业的数据采购合同,不能只写:
“甲方向乙方提供XX数据。”
还应当进一步明确数据来源、授权范围、使用目的、是否允许加工、是否允许用于机器学习或模型训练、是否允许形成衍生数据集、是否允许商业使用,以及出现第三方权利主张后的责任机制。
海天瑞声披露的业务模式提供了一个很有价值的观察样本。
其公开披露显示,在定制服务模式下,公司根据客户需求提供定制训练数据集并收取服务费,但不享有最终生成训练数据的知识产权,也不能将该类业务生产的训练数据向其他客户重复销售;而对于标准化产品,公司开发具有自有知识产权的训练数据集,通过授权许可实现多次销售。上海证券交易所
同样都是“训练数据”,背后的权利结构完全不同。
这恰恰说明: 数据能不能用,不只取决于企业有没有拿到数据,还取决于企业究竟拿到了什么权利。 06|客户数据和用户数据进入训练集,是另一条链对于今天的大模型企业,这可能比传统数据采购更加值得关注。
假设一家企业提供AI办公助手。
客户每天向系统输入:
合同、代码、邮件、会议纪要、客户资料和内部制度。
从技术架构上看,这些数据可能沿着下面的路径流转: 用户输入 → AI应用 → 日志 → 数据仓库 → 数据筛选 → 训练数据集 → 模型优化 问题发生在最后几步。
用户把一份合同交给AI进行总结,与平台把这份合同用于后续模型训练,并不是同一个技术处理动作。
前者的直接目的可能只是:
完成一次合同总结。
后者则意味着:
数据进入新的模型训练流程。
如果其中涉及个人信息,需要结合具体处理活动判断其合法性基础;如果是企业客户上传的数据,还可能涉及客户合同、保密义务、商业秘密以及数据处理约定。
因此,对于AI SaaS或者模型服务企业,一个非常重要的核验点是: 客户数据、用户输入和产品运行日志,会不会进入模型训练体系? 如果答案是“会”,就应该继续向下追:
谁决定进入?
什么数据能够进入?
有没有过滤?
有没有脱敏?
用于预训练、微调还是评测?
是否使用第三方基础模型?
是否发送给其他主体?
训练以后如何处理原始数据?
这些问题最终都应该能够在技术架构、制度、合同和运行记录之间找到对应关系。
07|训练数据真正复杂的地方,在“加工链”数据取得以后,并不会直接进入模型。
尤其对于高质量训练数据,往往还需要经历大量加工。
海天瑞声早期招股材料中披露,其数据处理涉及校对、标注等环节;自然语言处理数据还涉及分词、词性标注、命名实体标注、翻译、情感标注以及结构化信息提取等处理。上交所静态网站
到了大模型阶段,数据工程链条可能进一步扩展为: 采集 → 解析 → 清洗 → 去重 → 分类 → 过滤 → 脱敏 → 标注 → 数据集构建 → 预训练 → SFT → 对齐/强化学习 → 评测 这意味着,企业真正需要管理的不是一个“数据文件夹”。
而是一条数据生产流水线。
更重要的是,这条流水线上可能不只有发行人自己。
OCR可能由外部服务商完成。
数据标注可能外包。
云存储可能由云厂商提供。
部分模型训练可能使用外部算力。
数据处理可能由合作伙伴承担。
《网络数据安全管理条例》第十二条要求,向其他网络数据处理者提供、委托处理个人信息和重要数据时,应通过合同等约定处理目的、方式、范围以及安全保护义务,并监督接收方履行义务;相关处理情况记录至少保存3年。国家应用平台
因此,从IPO尽调角度看,仅仅盘点“公司有哪些训练数据集”是不够的。
还需要继续向下穿透: 这些数据集是怎样生产出来的,生产过程中还有谁接触过数据。 08|数据出境问题,也不能只看服务器在哪里海天瑞声后续关于“AI大模型训练数据集建设项目”的公开回复,也提供了一个值得注意的观察角度。
公司在相关披露中区分了不同数据集的来源和数据属性,并对是否涉及数据出境安全评估进行了分析。例如,其披露部分多语种语音数据集、多语种多模态数据集主要涉及境外采集的外国人个人信息数据,并说明当时项目尚处于前期调研和可行性论证阶段,尚未发生相关数据出境情形;同时表示,如果后续出现依法需要申报数据出境安全评估的情形,将履行相应程序。上交所静态网站
这里真正值得关注的不是某一家公司的具体结论。
而是这种分析方法: 先识别数据是什么 → 再识别数据从哪里来 → 再识别数据向哪里去 → 最后判断适用什么规则。 对于AI企业尤其如此。
因为一家公司可能同时存在:
境内采集的数据、境外采集的数据、境外客户提供的数据、境外训练或推理服务,以及跨区域部署的云基础设施。
所以: “模型部署在哪里”只是数据跨境分析的一部分,“数据实际怎么流动”才是基础。 09|从招股说明书看AI企业,不能只搜索“数据合规”这是我认为研究AI公司招股说明书时特别值得建立的一种方法。
“数据合规”
很可能看不到真正重要的问题。
应该把招股说明书拆开交叉阅读。
看到“核心技术”,要问数据在技术能力里承担什么作用。
看到“竞争优势”,要判断所谓数据壁垒到底来自数量、质量、独占来源,还是长期业务积累。
看到“采购”,要找数据供应商、标注服务商和云计算服务商。
看到“知识产权”,要继续判断数据集、软件、算法和模型之间是什么关系。
看到“客户”,要判断客户提供的数据是否进入企业的数据资产体系。
看到“风险因素”,则要寻找知识产权、数据安全、个人信息、网络安全和数据跨境等风险。
最后再去看: 监管问询到底问了什么。 监管问询有时候比招股说明书正文更有研究价值。
因为招股说明书告诉你:
企业想说明什么。
问询回复则更容易让你看到: 审核人员真正想弄清楚什么。 10|真正需要建立的,是一条“训练数据权利链”如果把前面的问题再压缩,我认为可以用五个英文单词概括: Source → Right → Process → Model → Evidence 这可以作为分析AI企业训练数据的一套基本框架。 Source,是来源。 数据到底来自公开网络、自主采集、第三方采购、合作方、客户,还是用户。 Right,是权利。 企业为什么能够取得、复制、加工和使用这些数据,相关合同或者其他依据能够支持到什么范围。 Process,是处理。 数据经过了哪些清洗、标注、脱敏、筛选和加工,中间有哪些第三方参与。 Model,是模型。 数据究竟用于预训练、微调、对齐、评测还是其他环节,进入了哪个模型。 Evidence,是证据。 当监管机构、交易所、客户或者权利人要求企业说明数据来源时,企业能够拿出什么证明。
这最后一层尤其重要。
因为“公司认为数据来源合法”和“公司能够证明数据来源合法”并不是同一个治理状态。

11|IPO之前,更值得做的是一次“穿透式数据盘点”如果一家AI企业准备IPO,我认为训练数据尽调不应该从“整理合规制度”开始。
更有效的方式,是随机选择几个真正用于核心模型的数据集,然后反向穿透。
例如选中 Dataset A。
先找到它目前存放的位置。
再找到它对应的模型。
然后往前追:
数据从哪里来?
如果来自供应商,找到采购合同。
如果来自公开互联网,找到采集规则和采集记录。
如果来自用户,找到当时适用的协议、告知文本和产品版本。
如果经过外部标注,再找到标注供应商。
然后继续核验: 原始数据 → 清洗数据 → 标注数据 → 最终数据集 → 模型版本 能不能对应起来。
这一步的价值非常大。
因为它验证的不是:
“公司有没有数据管理制度。”
而是: “公司能不能解释一个真实训练数据集从出生到进入模型的全过程。” 对于一家AI企业,这两种能力之间的差距,可能就是形式合规与实质治理之间的差距。
12|2026年的变化:资本市场开始把“数据治理能力”纳入技术判断回到这篇文章最开始的问题。
为什么现在值得从招股说明书研究训练数据?
一个重要原因是,资本市场评价AI企业的方式本身正在发生变化。
2026年上交所针对人工智能大模型企业适用科创板第五套上市标准的审核指引,不仅关注算法创新、模型规模及复杂度、能力表现、鲁棒性和安全性、多模态与智能体技术突破等指标,还明确纳入了数据获取和治理能力。中国证券指数公司
与此同时,该指引第十条明确要求人工智能大模型业务或产品符合数据安全与隐私保护、知识产权保护等相关规定;涉及境外业务的,还应符合技术出口、数据跨境等相关安全规定。中国证券指数公司
需要注意,这并不意味着交易所已经建立了一套统一的“训练数据合法性评分标准”。
也不能由此推导出所有AI企业都必须按照完全相同的方式披露每一项训练数据。
但它至少表明: 数据获取和治理,已经可以进入资本市场评价大模型企业技术优势与合规经营的正式框架。 这是一个很重要的变化。
13|进一步的判断:未来AI企业需要证明的,可能不只是“模型是谁做的”软件企业上市时,知识产权尽调经常追问:
软件是谁开发的?
代码是谁写的?
核心专利属于谁?
AI企业会让这个问题进一步复杂化。
未来可能还需要不断回答: 模型是用什么数据训练出来的? 因为模型能力的形成,背后同时存在: 代码来源、基础模型来源、训练数据来源、算力来源和人工贡献。 其中任何一个环节出现重大权利瑕疵,都可能影响企业对核心技术资产的解释。
这也是为什么我认为,未来AI企业的IPO法律尽调中,会逐渐形成一条不同于传统软件企业的核查链:
数据来源
↓
取得依据
↓
权利范围
↓
数据加工
↓
训练数据集
↓
模型训练
↓
模型版本
↓
商业产品
↓
证据留存
这条链的核心并不是要求企业证明“所有数据绝对没有任何风险”。
对于大规模数据处理系统而言,这种表达本身就应该谨慎。
更现实的治理目标是: 企业知道数据从哪里来,知道哪些数据风险更高,建立相应的控制措施,并能够通过记录和证据还原关键处理过程。 结语AI时代,数据正在出现一种很有意思的双重属性。
从技术角度看,它是训练模型的基础资源。
从企业治理角度看,它又是一系列权利、合同、个人信息保护、知识产权、数据安全和供应链关系的集合。
所以,阅读一家AI公司的招股说明书时,看到“海量数据”“高质量数据集”“数据壁垒”这些词,真正值得继续追问的已经不是: 有多少数据? 而是: 这些数据从哪里来,为什么可以使用,经过了什么处理,进入了什么模型,以及企业如何证明这一切。 从这个角度看,AI企业真正有价值的数据能力,也许可以重新定义为: 能够持续、稳定地获得高质量数据,并能够把数据的来源、权利、处理、模型使用和证据链管理起来。 模型能力最终会不断迭代。
但一家企业能不能把数据合法、稳定、可持续地转化成模型能力,可能才是更长期的基础能力。
说明:本文关于海天瑞声的具体业务、训练数据生产方式及权利安排,均依据其公开招股及后续披露材料;海天瑞声属于人工智能训练数据服务企业,并非本文将其表述为2026年审核指引所称的“大模型企业”。文中 Source—Right—Process—Model—Evidence 为本文提出的分析框架,并非现行法律法规或交易所规定的法定审核标准。现行大模型IPO相关要求以2026年6月17日上交所发布的审核指引为准。中国证券指数公司

本文仅用于专业研究与交流线上炒股融资平台,不构成针对具体企业IPO、数据合规事项的法律意见。
文章为作者独立观点,不代表中国股票配资网_股票配资网_实盘配资排行榜观点