NuminorBeta
源数据v1.0

SmarTag 智能标签

News labels, relevance, sentiment, summaries (9 card tables).

按字段购买

23 个计价字段

挑选你需要的字段 —— 下方按字段单独计价。

整套$2,270/月

比逐字段购买省 20%

按年预付 · 省 20% —— $21,792/年

可在下方字段列表中一次全选,加入清单后直接结算,即可获得整套。

SmarTag 智能标签

smartag源数据

News labels, relevance, sentiment, summaries (9 card tables).

每日源缝合 · 数据前沿 2026-08-04

9. 字段说明 — 全部字段

完整的字段字典——逐表、逐字段列出类型与含义。每张表附一条真实样本记录。

news_info

数据表 · 共 9 张,选择其一

news_info

14 个字段 · 记录粒度(主键):newsid

字段名称类型可空说明
operation变更标志(A/U/D)字符串变更流标志,标记该行是新增(A)、更新(U)还是删除(D)一条文章记录,使订阅方可将数据作为增量变更流应用。SmarTag 新闻为仅追加,因此数据集中的每一行都是新增(A)。
newsid ·主键新闻ID字符串文章的唯一标识(一个数字型文章 id),也是本表的主键——每条新闻文章对应一行。所有标签表都引用该字段,因此它是将一篇文章关联到其公司、人物、产品、地区、概念、事件、行业及情感的连接键。
newstitle新闻标题字符串采集到的文章标题。几乎每篇文章都有值。
newstitle_cn新闻标题(中文)字符串文章标题的中文形式。对于中文来源,与标题一致;当原文语言不同时,此字段给出中文译写。几乎每篇文章都有值。
newsts新闻时间戳(采集时间)时间戳文章被采集并打标签的时间——用于截至(as-of)查询和免前视查询的时点锚点。取值范围为 2017-01-01 至当日;以该字段为每个标签定日期,可精确重建任一历史日期上可知的信息。
newsoriginalts原文发布时间时间戳来源报告的文章原文发布时间——区别于采集时间(新闻时间戳)。取值自 2017-01-01 起,几乎每篇文章都有值;当您需要真实的发布时刻、而非 SmarTag 摄入该文的时间时,使用此字段。
newsurl新闻链接字符串文章发布所在的网址。几乎每篇文章都有值。
newssource新闻来源字符串文章所来自的媒体或门户——例如 新浪网(Sina)、东方财富网(Eastmoney)、同花顺财经(Flush)、证券之星、金融界。共出现数千个不同来源;约 5.8% 的行为空。
newssummary新闻摘要字符串文章的简短摘要或导语段落。几乎每篇文章都有(空值低于 0.001%)。此为摘要/概要——完整正文是单独的产品,不属于 SmarTag。
whitelistflag白名单标志整数标记文章是否位于 SmarTag 精选的相关财经新闻白名单中:1 = 在白名单内(约占 90% 的文章),0 = 不在(约 10%)。筛选为 1 即可得到清洗后的财经新闻流。
newsextid外部新闻ID字符串文章的外部来源标识(一个哈希值),用于对照来源数据流去重;约 5.4% 的行为空。
emotionindicator情感倾向(0/1/2)整数文章级别的情感倾向:0 = 中性,1 = 正面,2 = 负面。请注意此映射——负面为 2 而非 0。在全部历史中,约 52% 的文章为正面,24% 为负面,24% 为中性。
emotionweight情感置信度权重数值情感标签的置信度权重,取值 0.33–1.0(中位数约 0.88)——数值越高表示模型对判断越确定。可与情感标签配合使用,以剔除低置信度的分类。
emotiondetail情感三分类权重字符串完整的情感分解——模型在三个类别上各自的权重,格式为 {0=neutral, 1=positive, 2=negative},例如 {0=0.0088, 1=0.9892, 2=0.002}。情感标签即为这三个权重的取最大值(arg-max);当您需要软分值而非硬标签时,使用此字段。

样本记录:

operation:        A
newsid:           136341720
newstitle:        中国学者首次获得门捷列夫国际基础科学奖
newstitle_cn:     中国学者首次获得门捷列夫国际基础科学奖
newsts:           2026-07-13 00:00:06
newsoriginalts:   2026-07-12 23:53:00
newsurl:          http://www.chinanews.com.cn/sh/2026/07-12/10658059.shtml
newssource:       中国新闻网
newssummary:      中新社合肥7月12日电 (记者 吴兰)记者12日从中国科学技术大学获悉,联合国教科文组织近日正式宣布,中国科学院院士、中国科学技术大学教授潘建伟荣获第三届门捷列夫国际基础科学奖…
whitelistflag:    1
newsextid:        b300f89643ec13e336173e8a4ad9cfeb
emotionindicator: 1
emotionweight:    0.99
emotiondetail:    {0=0.0088, 1=0.9892, 2=0.002}
·
$250/月 每字段
$38/月 每字段
$13/月 每字段
免费

按 数库 原样交付,已解析代码与结构化关系由 Numinor 计算。许可直接转授予你;字段完全按供应商发布的形式提供。

01

获取方式与常见问题

我可以只购买其中几个字段吗?
勾选你想要的字段,即可看到实时小计。选择全部字段时将自动套用整套价格。加入数据篮后直接结算 —— 无论是本数据集,还是跨多个数据集组合的字段。
购买前,我可以在 Matrix 中评估这些字段吗?
可以 — 在 Matrix 中加载真实的源数据表,用 AI 智能体分析(时点滞后),在购买前确认字段是否符合你的用途。开通后,可通过 API 导出你选择的字段。
如何交付?
以 Apache Parquet 格式通过签名 URL 的 REST API 交付,与构建数据同一通道。免费的 Matrix 沙盒提供滞后视图用于评估。
每次更新何时可用,可靠性如何?
源数据按 ChinaScope 的频率更新,并通过与构建数据相同的签名 URL 管道交付,具有相同的清单/状态机制。购买前可在 Matrix 中自行评估数据新鲜度。
为什么有些字段免费,有些却要数千美元?
价格取决于不可复制性。已解析的代码与结构化关系是护城河;机器评分与原始文本较便宜;标识主键免费。数值型字段按表计价;代码在整个数据集内只计一次。

还有疑问? 联系销售