Reference
Answers to the questions that come up when you actually use Chinese equity market data. Each one spans several datasets, which is why none of them fits on a product page. Every figure comes from our own onboarding notes on the data we sell.
关联中国 A 股公司数据时,为什么会悄悄丢行
中国公司数据的实体对齐本就是部分完成的,不同数据集、甚至同一数据集内不同关系类型的对齐率差别很大。内关联会正好丢掉那些未对齐的行,而它们不是随机样本。
11 datasets
哪些中国 A 股数据集真的是时点数据,哪些只是看起来像
只有当一个数据集告诉你某个数字何时公开、而不只是它覆盖哪个会计期,它才是时点数据。不少常用的中国数据集只带会计期而不带披露日期,读起来像时点数据,其实不是。
10 datasets
缺失、零值还是空白:中国财报数据里的三种不同状态
真实的零、申报主体留空的单元格、以及根本不存在的那一行,在财报数据里是三种不同的状态。把它们并成一种,你会造出一张全是从未被报告过的零的面板。
4 datasets
中国 A 股数据里的代码与单位陷阱
情绪值里 2 表示负面,同一个数据集里股权比例有两种单位,标准化科目会盖住如实上报的原始标签。每一个读错了都照样返回合理的数字。
4 datasets
披露与推断:中国供应链与股权数据的两个类别
披露数据是公司自己公告的内容,抵达时已按合并口径汇总。推断数据是构建出来的,本来就是为了汇总而做的。两者规则相反,把其中一种当成另一种,不是重复计数就是严重低估。
7 datasets
一家公司,多只证券:为什么 A 股公司数量会偏高
公司的事实会挂到它的每一只上市证券上,所以有两个上市地的公司会出现两次。按股票代码而不是公司主键分组,会让每一个公司层面的汇总都偏大。
6 datasets
中国公司数据中,什么时候该上卷子公司,什么时候会重复计数
是否上卷,取决于这个数据集是否已经替你做过。数库有些表已按合并口径汇总,有些刻意没有,而 SAM 里有一个字段是子树合计,看上去完全可加,其实不是。
7 datasets
主键与粒度:为什么对中国财报数据去重会删掉真实的行
唯一标识一行的字段,和说明这一行讲什么的字段,不是同一回事。按后者去重,会悄悄删掉真实的披露。
8 datasets
做中国股票研究该用哪一棵行业树
数库参考数据在同一张表里承载五套彼此独立的行业分类方案。它们是并列的树,而不是同一个层级结构的不同层,把它们混在一次分组里没有意义。
5 datasets
每日交付不等于每日数据
交付节奏和数据节奏是两件不同的事。有几个中国数据集每天交付、每半年才有新数据,而股权关系里有一张表比它的同伴整整落后一个期间。
2 datasets