Bastix
Insights

信息范式的转变:从「人工读」到「机器代读 + 研判」

金融信息正从人工逐篇阅读,转向机器持续覆盖、去重抽取、混合检索、评分排序、证据溯源与人工门控的"机器代读 + 研判"范式——机器负责覆盖,人对高风险判断与投资行动负责。Bastix 是只做研究、不下单、不连券商、不承诺收益的投研智能体,其信息雷达只做只读研判、不替用户下单或调仓。

执行摘要

金融信息处理正在发生的核心变化,不是把“读公告、读研报、读新闻”简单交给一个聊天机器人,而是把投研的信息链条从人工逐篇发现、阅读、摘录与排序,重构为机器持续摄取、去重、抽取、检索、评分、证据绑定与初步研判,人工集中处理高价值、高不确定性和高风险事项。这是一种从“人的阅读吞吐量决定覆盖度”到“机器覆盖全量信息、人的注意力用于验证与决策”的范式转变。

这一变化首先有量级基础。按美国 SEC 公开的 EDGAR 分表单年度数据汇总,公开电子申报数量从 2015 年约 66.56 万份上升到 2025 年约 85.80 万份,十年增加约 28.9%,对应复合增速约 2.57%/年;2026 年仅上半年已有约 49.68 万份,但不应把半年数据机械年化。SEC 同时披露,EDGAR 平均每天处理约 4,700 份申报文件,每年向公众提供约 3,000 TB 数据。 这些数字只代表美国监管披露体系,并不等于全球金融信息总量;但它说明,仅“一级事实源”的规模就已使全量人工阅读越来越不现实。

新闻与另类文本的机器化供给同样已经达到工业规模。LSEG MarketPsych 公开资料显示,其文本分析覆盖 4,000 多个新闻和社交媒体来源、约 13 万家全球公司/行业/ETF,并可按 60 秒、小时和日频产生机器可读的情绪、主题及其他文本指标。 但对于“A 股全市场公告量过去十年的统一同比增速”以及“中国卖方研报全市场年度总量及增长率”,本次检索没有找到由交易所、监管机构或覆盖全市场的数据提供商公开发布的、口径连续且可复核的长期时间序列,因此应明确写作:暂无公开证据,而不是用局部平台条数外推全行业。

行为与金融学证据表明,问题也不仅是“信息越来越多”,更是注意力具有稀缺性。Speier、Valacich 与 Vessey 的实验研究发现,中断对简单任务可能改善表现,但会降低复杂决策任务表现,且高频、内容差异大的中断会进一步恶化复杂任务表现;Hirshleifer、Lim 与 Teoh 则在金融市场数据中发现,当投资者面对更多无关信息时,对盈利公告的即时市场反应会减弱。 因而,“机器代读”的真正价值不是压缩字符数,而是降低无关中断、改变信息排序,把有限人工注意力配置给最值得核验的事件

技术上,这一范式不是单模型完成的。成熟路线更接近“实时事件流 + 文档解析/信息抽取 + 金融领域模型 + 混合检索/RAG + 评分排序 + 证据溯源 + 人工门控”。FinBERT 一类金融领域语言模型解决通用词义与金融语境不匹配的问题;RAG 让生成过程能够检索外部证据而不是只依赖模型参数记忆;Kafka/Flink 一类基础设施则承担持续摄取、状态计算和事件时间处理。

但“RAG + 大模型”不能等同于“事实正确”。FinanceBench 在其 2023 年公开基准中,对 150 个金融问答案例进行人工审查时发现,当时测试的 GPT-4-Turbo 加检索系统有 81% 的问题答错或拒答;FinQA 也显示,当时的大型预训练模型在复杂金融数值推理上远落后于专家水平。这里必须强调:这些是特定时期、特定模型配置的历史基准,不能直接代表 2026 年最新模型的错误率;它们能支持的结论只是——增加检索并没有消除金融推理、引用和数值计算的验证需求。

文本本身则确有资产定价与基本面信息含量。Tetlock 对媒体悲观程度的研究、Tetlock 等人对公司新闻语言的研究,以及 Loughran 与 McDonald 对 10-K 金融词义的研究,都表明文本特征与后续价格、成交量、盈利或市场反应存在统计关系;但这些研究同时提醒,“文本有信号”不等于“一套情绪分数可以跨市场、跨时期稳定赚钱”

因此,最合理的目标不是从“人工研究员”直接跳到“自主投资机器人”,而是从:

人工找信息 → 人工读信息 → 人工整理 → 人工判断

转向:

机器全量监听 → 机器去重/抽取 → 机器排序/初判 → 证据级核验 → 人处理异常与高价值事件 → 人对投资行动负责

真正可持续的竞争力,也将从“谁能读更多”,转向“谁能覆盖得更全、过滤得更准、证据链更清楚、误报漏报可量化、模型失效可及时发现”。

信息过载量级:从“读得完”到“覆盖不了才是常态”

“信息过载”容易被写成一个泛化叙事,但对金融市场而言,至少需要区分三件事:信息绝对量是否足够大、信息量是否持续增长、人的有限注意力是否产生了可观测的决策后果。

首先看能够被权威数据直接验证的监管披露。SEC 的公开 EDGAR 数据按表单统计电子申报数量。将官方 CSV 中各表单年度数量加总,可得到以下量级;其中增速为基于 SEC 原始数据的本报告计算,而非 SEC 官方公布的增速指标。

时间EDGAR 公开电子申报总量说明
2015 年665,640按 SEC 各表单年度数量汇总
2020 年733,181同口径
2025 年858,005同口径
2026 年上半年496,842仅截至 2026 年 6 月,不作全年机械外推

从 2015 年到 2025 年,总量增加约 28.9%,十年复合年增长率约 2.57%。 这个增速本身并非互联网内容式指数爆发,但真正重要的是基数已经很大且披露持续到达:SEC 对 EDGAR 的说明称,该系统平均每日处理约 4,700 份申报,并每年向公众提供约 3,000 TB 数据。 对单个分析师而言,问题不再是“是否能读完所有材料”,而是“如何确保重要事项不会因为人的固定阅读时间而漏掉”。

其次,机器需要面对的不是单一监管源,而是多源异构文本。LSEG MarketPsych 的公开产品资料显示,其输入来源超过 4,000 个新闻和社交媒体渠道,并将文本映射到公司、ETF、国家、货币、商品等实体,生成情绪、主题和其他机器可读分数。 LSEG 的 Machine Readable News 文档又明确把实时新闻流描述为可供应用程序自动消费和系统分析的结构化新闻、元数据、事件及情绪数据流。 这意味着信息产业自身已经从“给人看的新闻终端”演化出“直接给算法消费的数据接口”。

但这里必须避免两个常见的论证跳跃。

第一,海外市场可验证的数据不能直接代替中国市场数据。截至 2026 年 8 月 16 日,本次检索未找到一套由权威公开来源提供的“A 股全部上市公司公告年度总量、统一口径、至少十年连续”的时间序列,因此对“A 股公告增速究竟是多少”应标注 暂无公开证据。同样,本次检索也没有发现能够覆盖中国全部券商、全部研究品类且连续披露年度总量的卖方研报官方统计,因此“中国研报数量每年增长 X%”之类精确数字亦属于 暂无公开证据,不宜引用商业搜索页面的局部索引量替代。

第二,“信息过载”不能机械定义为“条数多”。实验研究发现,信息中断对简单任务和复杂任务影响不同;对复杂判断而言,高频中断尤其有害。 金融市场证据进一步显示,投资者注意力被其他信息占用时,市场对真正相关的盈利消息可能出现较弱的即时反应。 Barber 与 Odean 对个人投资者的研究也发现,投资者更容易买入新闻曝光、异常成交或极端收益等“抓眼球”的股票,其解释之一正是面对成千上万只潜在买入股票时的搜索与注意力约束。

因此,范式变化的第一步可以表述为:

从“把更多信息交给研究员”到“先用机器建立注意力分配机制”。

后者的产物不应只是“更短的摘要”,而至少应该包括:哪些信息值得看、为什么值得看、与哪些资产相关、结论依据是什么、哪些字段仍不确定、是否存在相互冲突的来源。换句话说,机器代读首先是优先级系统,其次才是摘要系统。

技术路径:从“单次问答”到“持续运行的信息流水线”

金融“机器代读 + 研判”如果只被理解为在聊天框中上传一个 PDF 再问“总结一下”,覆盖度和时效性都很有限。工业化路线更接近一个持续运行的事件处理系统:信息在到达时就被解析、标准化、映射到实体,并进入检索和风险评分,而不是等研究员主动发问。

在模型层,FinBERT 是这一技术演化的代表性早期路径。Araci 提出的 FinBERT 将预训练语言模型适配到金融语料和金融情绪任务,论文报告其在两个金融情绪数据集上相较当时基线改善了所评估指标。 它背后的意义比某个具体模型更重要:“positive/negative”在财经语境中不是普通英语情绪分类问题,而是领域语义问题。 Loughran 与 McDonald 更早就发现,在通用 Harvard 词典中被标记为负面的词里,约四分之三在金融文本中并不具有真正的负面含义,这直接说明领域错配会制造系统性误判。

在知识获取层,RAG 把模型参数记忆与外部检索结合起来。Lewis 等人的原始 RAG 工作把生成模型的参数化知识与可检索的非参数知识库结合,用检索结果辅助生成。 对投研而言,它的价值在于可以把“结论”绑定到公告、财报、新闻或内部研报原文,而不是要求语言模型凭训练记忆回答。然而,FinanceBench 的金融问答结果说明,找到文档、找到正确段落、正确理解表格、正确计算数字、最后生成正确答案,是不同的错误环节;检索层存在并不意味着后面几层自动可靠。

在检索工程上,只使用向量相似度也并非天然最优。OpenSearch 的官方混合搜索文档将关键词检索与语义检索组合在同一搜索流程中,这类设计在金融材料中尤其合理,因为股票代码、公司名、会计科目、监管表单号等对精确词匹配很敏感,而事件描述、同义表达和长文本问题又需要语义匹配。 因而,更稳健的架构通常不是“向量数据库取代搜索”,而是关键词、实体索引、结构化字段过滤和语义检索并用

在信息抽取层,目标则从“摘要全文”转向生成结构化事件。LSEG 的开发者资料公开展示了实体、事件、主题标签以及情绪分析,并将机器可读新闻作为实时 API 输出。 对投研而言,一个公告可以因此被拆成类似“公司—事件类型—发生时间—数值—同比/环比—涉及业务—不确定性—来源”的结构,而不是只留下一个自然语言摘要。这一步决定机器是否能够跨文档去重、检测同一事件的后续修订、比较多家公司和形成时间序列。

在实时基础设施层,Kafka 将“事件流”定义为持续捕获和处理来自不同事件源的数据,Flink 则面向有状态的有界/无界数据流处理,并提供事件时间、状态一致性等机制。 对金融信息尤其重要的是“事件发生时间、信息发布时间、系统抓取时间、模型完成处理时间”必须分开记录。否则,回测很容易把实际上尚未被市场获得的信息提前给模型,制造典型的前视偏差。

把这些技术拼起来,一个较为合理的“机器代读”流程可以表示为下图。该图是基于上述公开技术能力给出的架构性归纳,而非某一厂商的内部实现:

flowchart LR
    A[公告 / 新闻 / 研报 / 行情 / 内部资料] --> B[实时采集与事件流]
    B --> C[解析 / 标准化 / 去重]
    C --> D[实体与时间对齐]
    D --> E[信息抽取]
    E --> E1[事件]
    E --> E2[数值与指标]
    E --> E3[主题 / 情绪]
    E --> E4[公司 / 行业 / 资产映射]

    E1 --> F[关键词 + 语义混合检索 / RAG]
    E2 --> F
    E3 --> F
    E4 --> F

    F --> G[研判层]
    G --> G1[重大性]
    G --> G2[确定性]
    G --> G3[时效性]
    G --> G4[影响范围]

    G --> H[证据绑定与交叉核验]
    H --> I{风险 / 置信度门控}
    I -->|低风险| J[摘要 / 提醒 / 日报]
    I -->|高影响或低置信| K[人工复核]
    K --> L[投研判断 / 行动审批]
    J --> M[用户反馈]
    L --> M
    M --> C

这里最重要的架构变化是从“模型回答什么”转向“系统如何把错误限制在可发现、可回滚的局部环节”。例如,新闻抓取错、实体映射错、数字解析错、检索错、生成错,应该分别有日志、指标和测试,而不是最终只看一句“模型回答看起来是否合理”。

因此,成熟的 B 范式其实不是:

人工阅读 → LLM 阅读

而是:

文档中心的人工工作流 → 事件中心、证据中心、机器持续运行的工作流。

实证:文本信号有效性——从“文本可读”到“文本可量化,但不能把预测关系等同于稳定 Alpha”

机器代读是否有投资意义,关键不在模型能否“写得像分析师”,而在于金融文本是否存在可量化、可重复研究的信息含量。对此,学术文献已有相当长的证据链。

Tetlock 2007 年发表于 Journal of Finance 的研究使用《华尔街日报》市场评论文本衡量媒体悲观程度,发现较高的媒体悲观度能够预测随后市场价格的下行压力,并伴随后续向基本面的反转;极端悲观度也与更高成交量相关。 这项研究的重要意义并非证明“负面新闻可以买空”,而是说明非结构化媒体语言中的统计特征与资产市场行为存在系统关系

Tetlock、Saar-Tsechansky 与 Macskassy 2008 年进一步把分析从市场层面推进到公司层面。他们研究公司特定新闻中的负面词汇,发现负面词比例能够预测较低的公司盈利,同时股票价格对这类信息存在短暂的低反应,且与基本面直接相关的新闻中这种预测关系更强。 这为今天所谓“事件情绪—公司基本面—价格影响”提供了较早的实证基础。

但 Loughran 与 McDonald 2011 年的结果表明,信号是否有效高度依赖词义和领域建模方式。他们研究 10-K 文本时发现,通用 Harvard 词典中约四分之三的“负面词”在金融语境实际上并非负面,因此构建了金融专用词表,并研究这些文本变量与申报期收益、成交量、波动、欺诈、内部控制重大缺陷及意外盈利等变量之间的关系。 这直接反驳一种过度简化的做法:把通用情感分析模型套在金融新闻上,就称为“舆情 Alpha”。

Barber 与 Odean 的研究则从另一个方向说明了文本的作用机制:新闻不仅承载基本面,也决定注意力分配。他们发现个人投资者是新闻曝光、异常成交量、单日极端涨跌等“吸睛股票”的净买方,而买入端尤其存在从成千上万只股票中寻找候选标的的搜索问题。 这意味着“新闻重要性”至少包含两种不同的变量:它改变了基本面预期多少,以及它能吸引多少市场注意力。 两者不能混成单一正负情绪分数。

机器学习方法则进一步尝试从高维文本中学习信号,而不是预先固定词典。Ke、Kelly 与 Xiu 的 NBER 工作论文 Predicting Returns With Text Data 提出从新闻文本中学习用于预测资产收益的情绪表示。 这类工作说明,现代文本模型可以把词、短语和上下文压缩成可进入资产定价或收益预测模型的特征;但研究结果依赖具体训练期、样本、目标变量和组合构造,不能据此推出“一般意义上的新闻 NLP 必然具有可交易超额收益”。

因此,对“文本信号是否有效”的严谨结论应分成三层:

第一层,证据较强:文本包含与基本面、交易活动和资产价格反应相关的信息。 Tetlock 系列研究以及金融披露文本研究支持这一点。

第二层,同样证据较强:信号定义高度依赖领域、上下文和投资者注意力。 通用词典在金融文本上会系统误判,新闻曝光本身也可能影响交易选择。

第三层,暂无证据支持泛化命题:任何通用大模型的“利好/利空”判断都可以直接转换为长期稳定、扣除成本后仍有效的交易 Alpha。 不同论文研究不同市场、时期和目标;除非对一个具体系统做严格的样本外、实时和交易成本后测试,否则不能从“文本含信息”跳跃到“系统具有投资收益能力”。

这正是范式 B 中“机器代读 + 研判”与“机器自动交易”之间必须保留的边界:前者已有充分技术与实证基础,后者需要针对具体策略重新举证。

落地案例:从“按需问答”到“自动摘要、信息雷达与交易日持续运行”

公开产品已经呈现出三个逐步增强的层次:按需智能问答 → 文档到达后自动摘要 → 持续监听并主动推送/研判。 下表只记录截至 2026 年 8 月 16 日可以从官方产品页面、官方新闻稿或公开商店页面核实的已上线能力;厂商关于自身“准确”“高质量”等评价不视为独立性能验证。

为避免把“24 小时可访问”误写成“无人值守”,下表将“无人值守”限定为:无需用户每次主动发问,系统能够在文档到达、预设时间或持续信息流条件下自动运行。

产品 / 机构覆盖资产 / 市场自动化程度是否无人值守公开输出类型已知误报案例公开上线时间来源
LSEG MarketPsych / Machine Readable NewsMarketPsych 公开称覆盖约 13 万家公司、行业与 ETF,并涉及国家、货币、加密资产、商品等;具体各产品覆盖口径不同:实时 API、自动文本结构化与情绪/主题指标是,作为机器数据流水线;但它不是自主投资智能体实时结构化新闻、实体/事件/主题标签、情绪、buzz 等机器信号本次检索未找到可复核的具体产品级误报事件:暂无公开证据MRN 初始商业上线日期:暂无公开证据;官方开发者页面可追溯到至少 2016 年相关文章LSEG MarketPsych
AlphaSense Smart Summaries公开能力聚焦公司财报电话会等企业研究资料;完整资产边界未公开:暂无公开证据中高:新财报电话会发布后自动生成摘要部分是:官方称新电话会将在发布后数小时内自动生成摘要;并非持续交易日自治智能体重点 bullet、关键主题及对应原文引用本次检索未找到公开、可复核的具体产品级误报案例:暂无公开证据2023-06-15 公开宣布 Smart SummariesAlphaSense Smart Summaries
Bloomberg AI-Powered Earnings Call SummariesBloomberg Terminal 中的公司财报电话会;精确全量公司覆盖数:暂无公开证据:对财报电话会生成 AI 摘要官方公开发布稿不足以证明其为按交易日持续扫描的无人值守智能体:暂无公开证据财报电话会重点与主题摘要,辅助跨公司比较本次检索未找到公开、可复核的具体误报案例:暂无公开证据2024-01-22Bloomberg 官方发布
AI小财神 / 界面财联社、财跃星辰公开数据库覆盖新闻、公告、投研、行情、股票库,并支持财经、股票、基金相关查询;具体全市场边界未披露中高:问答、热点解读 + 个性化日报定时推送部分是:官方明确每日早晨整理并定时推送个性化投资日报;是否全程持续监听全部源,暂无公开证据问答、热点事件解读、行业/公司信息、个性化日报、主题与概念股关联未发现公开的具体误报个案;但官方 App Store 页面明确提醒大模型可能出现“幻觉误导”,因此不能解读为零误报2024-12-18 公测财联社发布App Store 风险提示
Bastix(大斑)信息雷达首个公开版本的数据查询覆盖中国市场 A 股、ETF 与指数;信息雷达公开描述为扫描最新公告与全行业资讯:官方信息雷达按交易日定时扫描、逐条评分和研判:公开版本说明明确为从盘前到盘后无人值守定时运行重大性、确定性、时效、影响广度四维评分;利好/利空及依据;受影响个股/板块和推断把握程度;只读广播本次检索未找到公开、可复核的具体误报案例:暂无公开证据;公开边界明确其只做信息研判,不替用户下单或调仓工作台2026 年 7 月首次公开;信息雷达所在 v1.0.9 的具体自然日发布日期官网未列出:暂无公开证据v1.0.9 信息雷达版本说明2026 年 7 月首次公开版本

这些案例说明,行业落地并不是沿着一个单一路径演进。LSEG 更接近传统量化基础设施——把新闻直接转成机器数据流;AlphaSense 与 Bloomberg 是“机器先读文档,人再读机器摘要及证据”;AI小财神已经加入定时个性化日报;**Bastix(大斑)**公开版本则进一步展示了交易日内从盘前至盘后定时运行、主动扫描公告和资讯并给出结构化研判的官方信息雷达。

但“自动化程度高”不能与“已证明决策效果高”混为一谈。上述公开资料绝大多数是厂商对已上线功能的描述,而非第三方、盲测、样本外的准确率报告。对于这些产品的公告漏报率、事件分类 precision/recall、利好利空校准度、跨市场收益贡献,以及极端行情下的性能,本次检索没有发现可统一比较的独立公开数据,因此均应视作 暂无公开证据,不能根据产品功能表反推出模型投资能力。

误报与偏差风险:从“模型会犯错”到“错误必须可发现、可计量、可阻断”

真正决定“机器代读”能否进入专业投研流程的,不是模型平均情况下有多聪明,而是:当它错的时候,组织能否知道它错在哪里,以及错误能否在影响投资行动之前被截断。

第一类风险是覆盖度风险。机器只能分析进入其信息宇宙的内容;一个系统即使对已摄取文本的分类准确率很高,如果缺少某交易所公告、地方监管文件、电话会文字稿或行业专业信源,最终结果仍可能是“高准确率地分析了一个不完整世界”。LSEG 公开覆盖数本身就说明任何商业信息集都有明确定义的源集合,而不是“整个互联网”。 因而覆盖度应独立于模型准确率考核,至少区分源覆盖率、抓取成功率、解析成功率、实体映射成功率

第二类风险是时效与时间戳风险。金融系统中的“快”并非只有一个延迟指标。源文件何时正式公开、采集器何时收到、解析何时完成、模型何时出结论、用户何时看到,可能是五个时间点。Flink 等流处理系统之所以区分事件时间并处理迟到数据,正是因为数据可能乱序或延迟到达。 对投研回测而言,应保存首次可见时间而非后来更新后的网页时间;否则“机器比市场早知道消息”的回测结果可能只是时间穿越。

第三类风险是检索正确、推理仍错。FinanceBench 的历史测试说明,加入检索并没有让金融问答自动达到生产级正确率;FinQA 则直接暴露了表格读取和多步算术推理的困难。 因此,RAG 只能解决“让模型有机会看到证据”的问题,不能自动解决“它是否引用对了证据、是否算对了数字、是否把同比和环比弄反”等问题。尤其在盈利预测、杠杆率、同比变化、单位换算等任务中,可执行计算工具和结构化数据核验通常应优先于自由文本心算

第四类风险是领域偏差和标签偏差。Loughran 与 McDonald 对通用负面词典的结果说明,一个看似客观的情绪指标可以因为词典不适合金融语境而产生系统性噪声。 更进一步,如果训练数据主要来自大型公司、英文媒体或高流动性股票,那么模型对小市值企业、地方产业链、中文监管表达或危机时期语言的表现是否等价,不能默认成立;对这种跨分布泛化,本次并无一项单一研究足以给出普遍结论,应通过目标市场自己的验证集验证。

第五类风险是**“重要性判断”与“方向判断”被混为一谈**。一条信息可能极其重要,但方向不确定;也可能方向明显,但已经被价格完全吸收。Tetlock 的研究本身就观察到某些媒体悲观信号之后存在价格反转,这提醒我们:文本方向与可交易收益不是同一个变量。 实务上应至少把“事件重要性、事实确定性、价格是否已反应、预期差、影响期限”拆开,而不是用一个 −1 到 +1 的 sentiment score 代替完整研判。

第六类风险是幻觉和错误引用被流畅语言掩盖。FinanceBench 把 hallucination 明确列为金融问答进入企业使用的限制之一;部分已经上线的金融 AI 产品也主动提示大模型可能产生幻觉。 因此,“回答带引用”仍不够:系统还应验证引用是否真的支持句子中的每一项数值和因果陈述。一个可点击到原文但原文并不支持结论的引用,仍然是错误。

第七类风险是监管与合规边界。中国《生成式人工智能服务管理暂行办法》对向境内公众提供生成式 AI 服务规定了信息内容、个人信息保护等义务;官方解释同时明确,未向境内公众提供服务的企业内部研发和应用不当然适用相同范围,因此“内部投研工具”和“面向公众的金融 AI 产品”需要区分。 2025 年 9 月 1 日起实施的人工智能生成合成内容标识制度进一步规定了符合适用条件的 AI 生成内容显式、隐式标识要求。

对证券业务本身,也不能因为用了 AI 就假定传统监管义务消失。美国 FINRA 的 Regulatory Notice 24-09 明确提醒会员机构,使用生成式 AI 和大语言模型时,既有监管义务仍然适用。 对中国市场而言,关于“大模型自动研判在何种具体产品设计和输出方式下构成证券投资咨询、荐股或其他受监管业务”,本次检索未发现一份可以覆盖所有 AI 智能体形态的统一官方解释,因此不能简单给出“一律属于”或“一律不属于”的结论:暂无公开证据支持这种一刀切判断,具体业务应按实际功能、对象、收费与输出行为进行法律合规审查。

由此可以形成一个更实用的风险分层:

环节典型失败推荐观测指标建议门控
信源采集漏公告、延迟、重复转载源覆盖率、采集成功率、首次到达延迟核心一级源缺失时告警
解析抽取数字/单位/实体识别错误字段准确率、实体映射准确率关键财务数字回查原始表格
检索找错文件、漏掉最新版本Recall@K、版本新鲜度、来源等级优先监管/发行人一级源
生成研判幻觉、错误因果、错误方向引用支持率、事实正确率、方向校准低置信度应允许明确“无法判断”
告警排序误报过多、重大事件漏报precision、recall、漏报率、告警负荷对“重大事件漏报”设更高成本
投资行动把信息结论直接当交易指令人工驳回率、异常损失、规则触发数高风险行动必须人工审批

这意味着范式 B 最关键的成熟标志不是“模型从不犯错”——现实中无法合理承诺这一点——而是模型可以拒答,系统能暴露不确定性,证据可回查,行动有独立门控

结论与建议:从“增加阅读效率”到“重构投研的注意力与验证机制”

“机器代读 + 研判”的长期意义,不是把分析师每天读 50 篇材料提升到“等价于读 500 篇”,而是改变投研组织的基本分工:机器负责覆盖,人负责承担判断责任。

从已有数据看,监管披露和多源文本的绝对规模已经足以让全量人工阅读成为不经济的目标;从实验与金融实证看,注意力约束会影响复杂决策和市场反应;从金融 NLP 文献看,文本确实包含基本面、情绪和注意力信号;从当前产品落地看,行业已经从问答式助手推进到自动摘要、定时日报、机器可读新闻流乃至按交易日持续运行的信息雷达。

但这些事实合在一起,仍然不能证明“全自动 AI 投研比专业人工投研更准确”。针对这一命题,目前缺少跨机构、统一数据集、实时运行、控制交易成本与市场冲击、并经过独立审计的公开对照研究,因此应写作:暂无公开证据。已有证据更稳健地支持的是“机器能扩展信息覆盖、结构化文本并辅助筛选”和“文本可以产生有经济意义的信号”,而不是“人已经可以退出最终判断环节”。

对金融机构和专业投研团队而言,更可行的目标架构应是“机器先读、人读例外”。正常、重复、低风险的信息由机器完成采集、去重、分类和摘要;重大、冲突、高不确定性或直接影响仓位的信息自动升级给研究员。这样,人从阅读流水线中释放出来,却没有从责任链中消失。

治理指标也应随范式变化。过去可以考核“每日覆盖多少公司、读多少篇研报”;未来更值得考核的是:

从旧指标转向新指标原因
阅读篇数信息源覆盖率 / 漏报率机器时代真正稀缺的是“没有漏掉什么”
摘要速度端到端事件延迟从公开到提醒的时间比写摘要速度更有意义
模型总体准确率按事件类型拆分的 precision / recall并购、业绩、监管处罚的错误成本不同
“回答有引用”逐论断证据支持率引用存在不等于引用支持结论
单次离线测试持续漂移监控市场语言和信息分布会变化
回测收益严格时间戳的样本外表现防止信息泄漏和前视偏差
自动化率可安全自动化率自动得更多不是目的,错误可控才是目的

上线治理可以采用“离线黄金集 → 影子运行 → 有限生产 → 持续审计”的顺序。首先用真实公告、新闻、财报和已知后续结果建立标注集,分别测事件识别、实体关联、数字抽取、方向判断、重要性排序和引用正确性,而不是只测一个总体问答分数。FinanceBench、FinQA 等工作的价值就在于揭示“看起来会回答”与“金融任务可验证地做对”之间存在明显距离。

随后,应先让系统在影子模式中与现有人工流程并行:机器可以生成告警,但不影响实际研究结论或交易;事后比较机器独有发现、人工独有发现、共同发现、机器误报和机器漏报。这比单纯让研究员给答案打“喜欢/不喜欢”更能够评估真实增量。

进入生产后,建议把“信息判断”和“行动执行”拆成两个权限域。摘要、事件抽取、优先级排序可以高度自动;涉及重大基本面结论、对外客户建议、实际仓位或交易指令,则应有更高层级的验证、授权和审计记录。这与当前金融 AI 的风险现实更匹配:检索、摘要和结构化处理的可验证性远高于完全开放式的自主投资判断。

最后,每个机器研判结果应至少保留原始来源、首次可见时间、抓取版本、模型/提示版本、检索片段、结构化字段、最终结论、置信度和人工修改记录。这不是为了让每个分析师阅读更复杂,而是为了使错误能够被定位:同一个错误究竟来自信源、解析、检索、模型还是人工确认,决定了下一轮应该改数据、改模型还是改流程。

因此,这一信息范式可以被最简洁地概括为三个“从 A 到 B”:

从人工“逐条读取”,到机器“持续覆盖”。

从文本“供人理解”,到事件、实体、主题和证据“同时供机器计算”。

从模型“替人下结论”,到系统“替人筛选、初判和举证,人对高风险判断负责”。

在金融市场这种高时效、高噪声、高错误成本的环境中,最后一条尤其重要。真正成熟的机器代读系统,不是最敢于给答案的系统,而是知道哪些事实已经有证据、哪些判断只有概率、哪些问题必须交还给人的系统。

延伸阅读

  • 信息雷达:本文所说的"机器代读"在 Bastix 的落地——按交易日无人值守读公告与资讯,给出与你标的相关的研判,而不是把整个新闻流倒给你。

参考来源

  1. EDGAR Filings by Form Type(官方数据 CSV)
    U.S. SEC · 支撑:EDGAR 申报十年量级与增速 · 访问日期:2026-08-16
  2. About EDGAR
    U.S. SEC · 支撑:日均约4700份年3000TB · 访问日期:2026-08-16
  3. MarketPsych: NLP & Predictive Analytics in Finance
    LSEG · 支撑:覆盖约13万实体4000+来源 · 访问日期:2026-08-16
  4. Text Structuring, Analytics & Sentiment
    LSEG Developer Community · 支撑:实时机器可读新闻数据流 · 访问日期:2026-08-16
  5. Apache Kafka Documentation
    Apache Kafka · 支撑:事件流持续采集与处理 · 访问日期:2026-08-16
  6. Flink Architecture
    Apache Flink · 支撑:有状态流处理与事件时间 · 访问日期:2026-08-16
  7. Hybrid Search
    OpenSearch · 支撑:关键词+语义混合检索 · 访问日期:2026-08-16
  8. Generative AI for Earnings Analysis: Smart Summaries
    AlphaSense · 2023-06-15 · 支撑:财报电话会自动摘要带引用 · 访问日期:2026-08-16
  9. Bloomberg Launches AI-Powered Earnings Call Summaries
    Bloomberg · 2024-01-22 · 支撑:财报电话会 AI 摘要 · 访问日期:2026-08-16
  10. 界面财联社推出首款智能体“AI小财神”今起开放公测
    财联社 · 2024-12-18 · 支撑:AI小财神公测、定时个性化日报 · 访问日期:2026-08-16
  11. AI小财神 App Store 产品页
    Apple App Store · 支撑:官方提示大模型幻觉风险 · 访问日期:2026-08-16
  12. v1.0.9 · 信息雷达 · 实时语音对话 · 期货投研方法论
    Bastix / 大斑 · 支撑:信息雷达定时扫描研判、只读广播 · 访问日期:2026-08-16
  13. 2026 年 7 月 · 首次公开发布
    Bastix / 大斑 · 支撑:工作台2026年7月首次公开 · 访问日期:2026-08-16
  14. 生成式人工智能服务管理暂行办法
    国家互联网信息办公室等 · 2023-07-13 · 支撑:面向公众生成式 AI 义务 · 访问日期:2026-08-16
  15. 国家互联网信息办公室有关负责人就《生成式人工智能服务管理暂行办法》答记者问
    中国网信网 · 2023-07-13 · 支撑:内部研发应用范围区分 · 访问日期:2026-08-16
  16. 《人工智能生成合成内容标识办法》答记者问
    中国网信网 · 2025-03-14 · 支撑:AI 生成内容标识要求 · 访问日期:2026-08-16
  17. Regulatory Notice 24-09: Regulatory Obligations When Using Generative AI and LLMs
    FINRA · 2024-06-27 · 支撑:既有监管义务仍适用 · 访问日期:2026-08-16
  18. The Influence of Task Interruption on Individual Decision Making: An Information Overload Perspective
    Decision Sciences(Cheri Speier et al.) · 1999-06-01 · 支撑:中断损害复杂决策任务 · 访问日期:2026-08-16
  19. Driven to Distraction: Extraneous Events and Underreaction to Earnings News
    Journal of Finance(David Hirshleifer et al.) · 2009-10-01 · 支撑:分心致盈利公告反应减弱 · 访问日期:2026-08-16
  20. All That Glitters: The Effect of Attention and News on the Buying Behavior of Individual and Institutional Investors
    Review of Financial Studies(Barber & Odean) · 2008-03-01 · 支撑:散户净买"吸睛"股票 · 访问日期:2026-08-16
  21. Giving Content to Investor Sentiment: The Role of Media in the Stock Market
    Journal of Finance(Paul C. Tetlock) · 2007-06-01 · 支撑:媒体悲观预测价格下行 · 访问日期:2026-08-16
  22. More Than Words: Quantifying Language to Measure Firms' Fundamentals
    Journal of Finance(Tetlock, Saar-Tsechansky & Macskassy) · 2008-06-01 · 支撑:负面词预测较低盈利 · 访问日期:2026-08-16
  23. When Is a Liability Not a Liability? Textual Analysis, Dictionaries, and 10-Ks
    Journal of Finance(Tim Loughran & Bill McDonald) · 2011-02-01 · 支撑:通用词典金融语境系统误判 · 访问日期:2026-08-16
  24. Predicting Returns With Text Data
    NBER Working Paper 26186(Ke, Kelly & Xiu) · 2019-08-01 · 支撑:从新闻文本学收益情绪 · 访问日期:2026-08-16
  25. FinBERT: Financial Sentiment Analysis with Pre-trained Language Models
    arXiv(Dogu Araci) · 2019-08-01 · 支撑:金融领域模型改善情绪任务 · 访问日期:2026-08-16
  26. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
    NeurIPS 2020(Patrick Lewis et al.) · 2020-12-01 · 支撑:参数+外部检索增强生成 · 访问日期:2026-08-16
  27. FinanceBench: A New Benchmark for Financial Question Answering
    arXiv(Pranab Islam et al.) · 2023-11-01 · 支撑:加检索81%答错或拒答 · 访问日期:2026-08-16
  28. FinQA: A Dataset of Numerical Reasoning over Financial Data
    arXiv(Zhiyu Chen et al.) · 2021-09-01 · 支撑:复杂金融数值推理困难 · 访问日期:2026-08-16