NuminorBeta

披露与推断:中国供应链与股权数据的两个类别

简短回答: 披露数据是公司自己公告的内容,抵达时已经按上市主体的合并口径汇总。推断数据是通过跨主体归集构建出来的,本来就是为了汇总而做的。两者的规则正好相反。对披露数据做上卷会重复计数,对推断数据不做上卷则只能看到真实规模的一小部分。

规则在两者之间反转

披露数据,所以不要上卷。 数库 C2C 披露数据承载的是上市申报主体的合并披露。把母公司的行与其上市子公司的行汇总在一起,会把同一批底层关系重复计算,因为母公司的合并数字里已经包含了它们。请把每一家申报主体的披露视为对该主体而言已经完整。(数据截止 2026-05-16。)

推断数据,所以要上卷。 数库招投标数据是相反的情形。与披露类财报不同,它本来就是为汇总而构建的:一家上市公司真实的招投标足迹,是它自身的行加上其所属主体的行之和,而其中很大一部分活动由未上市主体完成。每一条连边都标注了股权关系(relation_type)与合计持股比例(hold_ratio),因此你可以按持股比例加权,或只保留 50% 及以上的控股主体。(数据截止 2026-05-29。)

同一位分析师,同一个问题,两个数据集,两个相反的正确答案。

除了交易对手,一行披露还可能是什么

披露数据承载着申报主体自己的格式选择,其中有三种经常被误当作脏数据。

匿名化的交易对手是真实的行。 「客户一」这类占位符,是申报主体隐去名称的方式。金额与占比仍然是披露出来的。保留还是剔除都可以,但要有意识地决定,并且知道剔除它们会移除真实的披露价值。(数库 C2C 披露数据,数据截止 2026-05-16。)

小计会出现在交易对手名称字段里。 「合计」或「前五名合计」这类取值,是申报主体自己的汇总行,而不是单个交易对手。做交易对手层面的分析时请把它们过滤掉,否则你的前五大分析会把前五名算两遍。(数据截止 2026-05-16。)

一条汇总披露也是一条合法的披露。 「前五大客户」不是脏数据,它只是并非某一个交易对手。请明确决定你的分析是否包含这些行。(数库 C2C 时点数据,数据截止 2026-08-22。)

「谁拥有这家公司」有两个不同的答案

在数库股权关系数据中,母公司与实际控制人表来自股权结构图谱,那是按股权结构衡量的控制关系。前十大类表来自股东名册,那是已披露的持有人清单。实际控制人不一定是前十大登记股东,前十大登记股东也不一定控制任何东西。选错表不会报错,它只会给出一个不同而且看上去同样合理的答案。(数据截止 2026-05-16。)

同样的形态也出现在关系图谱(时点)中,internal_guaranty_detail 与 internal_guaranty_total,连同它们对应的对外担保与委托投资表,是由申报主体分别披露的。它们不是一个可以跨层求和的层级结构。把明细行加到合计上会重复计数。(数据截止 2026-08-23。)

推断数据带有它自身的构建痕迹

数库 SAM 的供应链图谱在 70,900 行中提供了 66,053 条去重后的连边。其中 3,122 条连边分布在两到三行上,因此有 4,847 行、占总量的 6.8%,是重复行。每一行都有自己的 id,那是声明的粒度,并且确实唯一。但如果你按产品对进行关联或计数,请先按三元组(primary_code、related_code、relation_category)去重,否则就会按这个比例虚增。这些重复行之间只有英文 relationship_description 不同,而中文字段无法用来判别,因为它只在约 0.13% 的行上有值。这是当前 V4 图谱构建方式的已知特性。(数据截止 2026-02-26。)

披露深度是一个汇总无法突破的上限

公司在披露每一条业务线时,会选定一个层级。一家车企报告的是「乘用车」,而不是分开的「轿车」与「SUV」。在数库产品分类体系中,第 1 到 3 层在分部数据里分布密集,第 5 层及以下则很稀疏。为了覆盖度,请上卷到父层级。汇总可以还原上层合计,但它无法凭空造出公司从未披露过的细节。(见 2026 年 7 月版数据档案。)

同样的上限也会表现为缺失的金额:招投标数据中约 27% 的中标记录 bid_price 为零,而图谱上的 bid_amount 只汇总已披露的中标金额。在衡量交易规模时,请按正金额筛选。(数据截止 2026-05-29。)

Datasets this page draws on

Related questions