做中国股票研究该用哪一棵行业树
简短回答: 选定一个发布方,然后待在它里面。数库参考数据在同一张表里承载五套彼此独立的行业分类方案,它们是并列的树,而不是同一个层级结构的不同层。把它们混在一次分组里,会得到一个看起来像行业分布、实际上没有含义的结果。
五套方案,一张表,没有共同主干
dict_industry 中有 3,170 个节点,分属五套标准方案,因此一家公司可以按团队已经在用的那套行业分类来归组。这五套方案是 CSF、GB/T、申万的两个修订版本,以及证监会分类。(数库参考数据,见 2026 年 7 月版数据档案。)
数据档案里的指示很直接:在关联之前先选定一个行业 publisher。 这五套方案是彼此独立的树,把它们混进同一个层级结构没有意义。它们之间没有可以回退的共同根节点,而且数据本身不会阻止你这么做。
SmarTag 使用的是第六套,也就是数库自有的、类 GICS 的行业方案,共 126 个行业。那又是另一个问题:它说的是这篇新闻讲的是什么行业,而不是这家公司注册为什么行业。(数据截止 2026-09-16。)
行业和产品不是同一个问题
行业方案说明这是一家什么类型的公司。数库产品分类体系说明它实际生产和销售什么,两者不能互相替代。分部收入、供应链图谱与主营产品判定,讲的都是产品分类体系,而不是某一棵行业树。
要把产品节点归并到任意层级,请使用 ancestors 路径,而不要递归解析 parent。它一步就能到达任意层级。(2026 年 7 月版数据档案。)
你能下探的深度,由公司披露到哪一层决定
公司在披露每一条业务线时会选定一个层级。一家车企报告的是「乘用车」,而不是分开的「轿车」与「SUV」。第 1 到 3 层在分部数据里分布密集,第 5 层及以下很稀疏。
为了覆盖度,请上卷到父层级。汇总可以还原上层合计,却无法凭空造出公司从未披露的细节,所以一个写在第 5 层的筛选条件并不是严格的筛选,它只是在那些恰好披露到那一层的公司里做筛选。(数库产品分类体系,2026 年 7 月版数据档案。)
选定一棵树之后的两个上卷陷阱
一个看上去可加的子树合计。 在 fin_secu_sam_product_calc 中,product_income 是子树上卷值,父节点的取值已包含其子节点,因此跨分类体系节点求和会重复计数。需要可加的分部收入时,请使用直接口径的分块数值 product_b_income。(数库 SAM,数据截止 2026-02-26。)
明细表与合计表不是层级结构。 在关系图谱(时点)中,internal_guaranty_detail 与 internal_guaranty_total,连同它们对应的对外担保与委托投资表,是由申报主体分别披露的。把明细行加到合计上会重复计数。(数据截止 2026-08-23。)