Bastix
Insights

从「AI问答」到「AI投研智能体」:证券研究正在发生什么范式转变

AI 正从"回答研究问题的模型"演化成"组织研究流程的软件系统";但研究基准、机构采用与监管态度都表明它仍是"有限自主"而非自主决策者。Bastix 是只做研究、不下单、不连券商、不承诺收益的投研智能体,主动披露召回片段可能进外部模型、运行记录尚未组成统一审计链的数据边界。

核心判断

2024—2026 年,证券投研领域出现的真正变化,并不只是“大模型回答得更好了”,而是软件的工作单位正在从一次问答,变成一个可以围绕目标持续推进的研究任务。Google 在 2024 年 12 月推出 Gemini Deep Research 时,已经把“先生成多步研究计划—连续浏览—根据新信息继续搜索—最后形成带来源报告”作为 agentic feature 的核心流程;OpenAI 在 2025 年推出 Deep Research,将其定义为能独立开展多步骤网络研究的 agentic capability;Anthropic 随后的 Claude Research 同样强调多轮搜索会根据前一步结果决定下一步调查方向。到 2025—2026 年,这种产品形态又进入金融数据终端和金融机构内部工作流:AlphaSense 推出面向商业与金融研究的 Deep Research agent,欧美大型银行则开始把 Agent 用在财富管理、客户尽调、运营等流程。

但“范式转变”不等于“证券研究已经被全自动智能体取代”。剑桥大学 Judge 商学院下属 Cambridge Centre for Alternative Finance(CCAF)的 2026 年全球调查显示,在受访金融机构中,52% 已处于 agentic AI 的“试点及以上”阶段,其中 29% 仍在试点,只有 23% 达到 Scaling 或 Transforming 阶段;与此同时,当前 AI 部署仍明显偏向流程自动化、数据与知识管理等内部运营,而非商业模式重构。也就是说,Agent 已经越过概念验证阶段,但距离“自主投资决策者”仍有很长距离。

对证券投研而言,更准确的判断是:

AI 正从“回答研究问题的模型”,演化成“组织研究过程的软件系统”。其近期价值主要是搜索、整理、计算、跨源核验、持续观察与报告生成;而不是取代投资责任主体,更不是天然等于自动交易。

这一边界尤其适用于本文案例之一 Bastix / 大斑。根据其目前公开产品文档,Bastix 是面向中国市场的投研工作台/研究智能体,具备对话、多步研究、工具调用、市场与网页查询、私有知识库和持续研究任务等已上线能力;其官方同时明确,内置能力不连接券商、不接管资金、不代替用户下真实订单,持续任务目前也被限制在“研究、观察与整理”,不用于直接交易。本文因此不会把 Bastix 描述成自动交易系统,也不会将其定位为荐股或收益承诺产品。

范式转变:从“生成答案”到“推进任务”

普通聊天机器人的基本交互结构,是:

用户问题 → 模型生成 → 用户读答案 → 用户自己决定下一步问什么。

Agent 的典型结构则变成:

用户给目标 → 系统分解任务 → 选择工具 → 获取外部信息 → 根据结果调整下一步 → 保存状态 → 再调用工具 → 汇总、核验并输出。

这一转向并非 2024 年才突然出现。其技术思想的重要起点包括 2022 年提出的 ReAct。论文把 reasoning 与 acting 交错起来:模型不仅生成推理文本,还能采取行动访问知识库或环境,再根据 observation 更新计划。作者在问答与事实核验实验中发现,与外部 Wikipedia API 的交互能够缓解纯 Chain-of-Thought 中的幻觉与错误传播。

随后 Meta 研究团队 2023 年发表的 Toolformer 更进一步,把问题具体化为:模型能否自己判断“什么时候调用什么 API、传什么参数、如何使用 API 返回值”?其实验工具包括计算器、搜索引擎、问答系统、翻译和日历。今天商业 Agent 中常见的 function calling / tool use,虽然工程实现并不等同于 Toolformer,但背后的产品逻辑高度一致:语言模型不再被要求把所有知识和计算都“从参数里想出来”,而是在必要时把工作交给外部工具。

LLM Agent 的学术综述也逐步将这一类系统视为一个独立研究对象。Wang 等人的综述提出统一框架来讨论 LLM-based autonomous agents 的构建、应用与评价,并把规划、行动、环境交互等视为核心问题。

对投研而言,这个变化尤其重要,因为很多问题本质上不是“语言问题”。例如:

能力普通问答式大模型Agent 式投研系统
获取最新公告/行情很可能依赖训练知识或用户粘贴材料可主动调用行情、公告、网页或数据库工具
多公司横向比较用户往往要逐个追问可拆解公司列表并批量执行相同研究流程
数值计算可能直接生成数字可调用代码、计算器或结构化数据接口
资料核验主要靠模型自身生成可回到网页、文件、数据库结果核对
长任务对话结束后状态容易丢失可把任务状态、文件、记录或检索索引持久化
工作流控制人不断决定下一问Agent 根据当前 observation 决定下一步
风险形态主要是错误答案和幻觉除错误答案外,还增加错误工具调用、权限、数据泄露和错误动作等风险

因此,“Agent”并不意味着必须拥有一个拟人化的机器人形象。FINRA 在 2026 年对证券行业 AI Agent 的描述更接近工程定义:它们能够规划、作决定、采取行动以完成目标,并可能访问多个数据源和系统;FINRA 同时把 conversational agents、trade surveillance agents、process automation agents 乃至 trade execution agents 区分为不同类型。这也意味着,“投研 Agent”与“交易执行 Agent”不是同一个产品类别。

从产品演化看,2024—2026 年可以看到一条相当清晰的时间线:Google 在 2024 年 12 月 11 日将 Deep Research 作为 Gemini 的 agentic feature 推出;OpenAI 在 2025 年上线 Deep Research,此后又增加视觉浏览、MCP 和应用连接能力;Anthropic 在 2025 年 4 月 15 日发布 Claude Research;AlphaSense 在 2025 年 6 月 10 日发布金融与商业研究 Agent Deep Research;Bastix 的官方版本记录则显示,其投研工作台首个公开版本于 2026 年 7 月上线。

这组产品不能证明“整个证券行业已经完成转型”,但足以说明一个产品范式已经建立:对话仍然是入口,但不再是系统能力的终点。

技术基础:工具调用解决“知道之外”,记忆解决“这一轮之外”

工具调用是金融 Agent 与聊天机器人的关键分水岭

证券研究天然依赖外部世界:股价会变化,公告会新增,财报会更新,指标需要计算,研究人员还可能有自己的内部文档。即使底层语言模型本身没有发生变化,只要给它增加可靠的数据接口、搜索、代码执行和文件检索能力,系统可以完成的任务边界就会显著扩大。Toolformer 所研究的“何时调用、调用哪个 API、如何使用返回结果”正是这一问题的理论原型之一。

以 Bastix 的公开产品文档为例,其当前列出的系统工具包括网页搜索和正文获取 web_context、标的搜索 search_stock、K 线/静态信息/龙虎榜/财报查询 symbol_profile_query、私有知识库语义检索 reference_knowledge_search、受限代码运行 run_ts、任务管理等;官方称同一份工具结果会分别形成供模型继续推理、会话记录和界面展示的输出。

这比“在聊天框里多放一个搜索按钮”更进一步。真正的 Agent loop 是模型可以根据上一步工具返回结果判断下一步。例如,一项行业研究可以先搜索公司列表,再逐家公司获取财务信息,发现异常后进一步搜索公告,最后把结果汇总;如果数据缺失,则改变检索路径。这正是 ReAct 所描述的 reasoning—action—observation 交替逻辑在工程产品中的一种延伸。

不过,工具调用并不会自动把错误率降到零。它只是把错误来源从“模型记错了”扩展为一整条链:模型可能选错数据源、调用错工具、传错参数、错读返回结果,或者基于正确数据形成错误结论。FINRA 已明确把复杂多步骤任务带来的可追溯性问题、权限越界、敏感数据以及幻觉列为 Agent 风险。

“长程记忆”本质上是信息工程,不是人类式记忆

Agent 的另一条能力轴是 memory。但业界所谓“长程记忆”,通常不应理解为模型像人一样永久记住所有经历,更准确地说,是把历史信息持久化,再在未来任务中检索需要的片段

LongMemEval 对这一点给出了很好的拆解:长期记忆系统至少涉及 indexing、retrieval 和 reading 三个环节;其 500 道测试覆盖信息抽取、跨会话推理、时间推理、知识更新和该不该拒答。论文发现,在持续交互环境中,其测试的商业聊天助手和长上下文模型出现约 30% 的准确率下降。换言之,“存下来了”不等于“下一次一定能正确想起来”。

Bastix 自己的产品文档对这一限制表述得相当明确:它会在沙箱内保存会话和研究上下文,但“检索结果可能遗漏、压缩或误关联上下文”;其文档也要求重要数字与结论回到原始资料或工具结果复核。

这对于投资研究尤其重要。假设一个 Agent 长期跟踪某家公司,旧的盈利预测、已失效管理层指引、历史持仓假设都有可能被再次召回。因此成熟的投研 Agent 需要的不只是“记得多”,还要知道信息何时产生、是否已失效、来自哪里,以及当前问题是否应该使用它。 这一判断是基于 LongMemEval 对时间推理与知识更新的测试框架以及现实投研信息时效性的推论,而不是已有证据表明现有产品已经普遍解决。

Bastix 还披露了另一个容易被宣传材料淡化的边界:其知识库召回片段在生成回答时可能发送给用户配置的外部模型,因此不能把其数据架构简单描述成“所有材料始终留在本地沙箱”。这是它目前公开可确认的“外部模型能力”之一,同时也是用户评估敏感研报、内部材料和第三方模型数据流时需要考虑的问题。

落地案例:Bastix 与通用、金融垂直 Agent 的差异

如果只看“能聊天”,这些产品看起来十分接近;真正拉开差异的是Agent 可以访问什么数据、调用什么工具、保留什么状态,以及被允许做到哪一步

产品官方定位与已公开 Agent 能力与证券投研的关系明确边界或需要注意之处
Bastix / 大斑2026 年 7 月首个公开版本上线。可围绕目标进行多步研究,调用中国市场行情/财务/网页/私有知识库等工具;保存会话和任务上下文,并支持持续任务。知识库召回内容可能交给配置的外部模型。明确面向中国市场投研,公开文档显示覆盖 A 股、ETF、指数及公告、财务等研究数据,并提供投研工作流能力。不连接券商、不接管资金、不代替用户真实下单;持续任务只做研究、观察和整理,不用于直接交易。“策略仓位”是沙箱账本,不是券商账户,也不代表真实成交。
AlphaSense Deep Research2025 年 6 月上线的金融/商业研究 Agent。官方称其可自动处理复杂研究任务,并使用 AlphaSense 超过 5 亿份商业与金融文档;企业版还可结合内部资料。四者中金融内容属性最明显的国际产品之一,可生成公司、行业研究及 M&A screening 等材料。“investment-grade”等属于厂商自身产品表述,不能视为独立准确性验证。公开页面本身并不能证明其研究质量始终达到人工机构研究水平。
OpenAI Deep Research / Agent能开展多步骤网络研究、搜索、解释和综合多种在线资料;2025 年增加视觉浏览,2026 年官方又宣布可连接 MCP 或应用,并可把搜索限制在可信站点。官方明确把 finance 列为 intensive knowledge work 的适用领域之一,但定位仍属于通用研究 Agent,而非证券数据终端。金融数据授权、具体行情覆盖和证券行业工作流取决于所连接的数据源/应用,不能仅凭通用 Agent 能力推断其拥有特定金融数据库。
Claude Research可在网页与连接的工作资料中执行多轮、彼此递进的搜索,并自行决定下一步调查内容;首发时支持结合 Google Workspace。适合跨公开网页、内部文档的研究流程,但官方定位是通用 Research 能力,不是证券投研专用终端。数据范围依赖可访问网页及用户授权连接的数据源;不能据此推断具备任何未公开的证券行情或交易能力。
Gemini Deep Research2024 年 12 月推出:先提出多步计划供用户修改或批准,然后反复浏览、基于新发现发起下一轮搜索,最后生成带原始来源的报告。是较早把“可见研究计划 + 连续网络检索”产品化的通用 Agent 案例。同样不是证券投研专用产品;其首发官方页面描述的是通用网络研究,并未宣称自动证券交易。

这张表反映了一个值得财经读者注意的产业分层。

第一层是通用研究 Agent。 OpenAI、Claude、Gemini 的优势在于通用推理、搜索以及与大量数字工作环境的连接。它们可以做投研,但“金融”只是任务域之一。

第二层是垂直金融研究 Agent。 AlphaSense 的竞争壁垒不仅来自模型,而包括其金融和商业内容库;Bastix 的公开定位则进一步聚焦中国市场研究数据、投研工具和长期研究工作流。换言之,模型能力逐步商品化之后,Agent 的竞争可能越来越落到数据权限、工具质量、研究工作流和可核验性上。这是根据上述产品架构作出的行业推论,而非这些厂商共同公布的结论。

对 Bastix 还需要额外做两项“去营销化”处理。

首先,官方文档虽然提供了策略仓位、目标仓位和历史等功能,但它明确说明这些属于沙箱账本,不包含能够证明真实下单、成交或滑点的信息,也不是交易日志;系统当前也没有统一的内置回测服务。因此,将这些功能描述为“自动实盘交易”或“完整量化回测平台”都超出了公开证据。

其次,截至本报告检索时,暂无公开证据显示 Bastix 已有可与主流国际 Deep Research 系统直接横向比较的独立第三方标准化准确率测试;也暂无可靠依据可以据此宣称它能提高投资收益率。本文因此只比较已经公开上线的产品能力和边界,不进行收益能力推断。

成熟度:已经进入生产环境,但更像“研究副驾驶”而非自主基金经理

判断 Agent 成熟度,不能只看 Demo,也不能只看厂商发布会。至少要区分技术产品化、机构采用和任务质量三个层面。

产品化已经成立

从 2024 年底到 2026 年,Gemini、OpenAI、Claude、AlphaSense 等相继把多步骤 Deep Research 做成正式产品;Bastix 于 2026 年 7 月公布首个公开投研工作台版本。Agentic research 已经不再只是实验论文中的软件范式,而是一个明确的商业产品类别。

金融机构采用已经开始规模化,但“试点”仍占很大比例

CCAF 的《2026 Global AI in Financial Services Report》基于行业、监管机构和供应商调查显示,81% 的受访金融服务公司已经在某种程度采用 AI;agentic AI 在行业受访者中的试点及以上采用比例为 52%,其中 29% 处于试点,23% 进入 Scaling 或 Transforming。传统金融机构的 agentic AI 采用比例为 45%,低于金融科技公司的 57%。

同一报告给出的另一个信号更重要:目前 AI 在金融机构中仍以内部运营为中心,受访机构最常见的试点及以上用例包括流程自动化、数据可视化、软件工程以及数据和知识管理;55% 的行业受访者认为衡量 AI 部署价值仍然困难,这一比例在大型金融机构中达到 76%。因此,把“采用 Agent”直接等同于“已经获得可验证的经济回报”并不成立。

路透社 2026 年 7 月对华尔街银行的调查报道也体现了这一过渡状态:KPMG 调查显示 51% 的银行正在试点 AI Agent;Morgan Stanley 已使用 Agent 辅助理财顾问处理任务,但该行同时表示,对投资组合决策仍保留人工监督,Agent 没有自主决定投资组合的权限。

另一个生产部署案例来自新加坡。路透社 2026 年 7 月报道,OCBC 旗下 Bank of Singapore 已开始部署 HELIOS agentic AI 平台用于客户尽调和信用风险资料等开户流程;报道时已有超过 100 名客户经理开始使用、约 50 名客户通过该系统完成开户。这个案例证明 Agent 已经可以进入高监管金融业务流程,但它仍然属于开户/尽调等业务流程自动化,而不是自主投资决策

研究质量距离人类专家仍有明显差距

这是判断“AI 投研 Agent 是否成熟”的关键反证。

2026 年发布的 DeepResearch Bench II 构建了 132 个跨 22 个领域的研究任务,并从专家撰写的调查文章中整理出 9,430 个细粒度评价项,经过超过 400 小时专家审核。论文称,在其测试的当时先进 Deep Research 系统中,最强系统也没有满足 50% 的评价项

金融垂直测试同样没有显示出“研究自动化已经解决”。2026 年 7 月的预印本 FinResearchBench II 使用 104 个真实金融研究问题和最终筛出的 2,600 个共识评价项测试 10 套 Deep Research 系统,论文报告的 item-level pass rate 从 22.23% 到 58.58%。需要指出,该基准大量使用 LLM judge 构建和筛选评价项,虽然作者对一个子集进行了人工一致性验证,因此其数字不应该被理解为绝对意义上的“研究准确率”;但它至少说明,不同系统之间依然存在显著质量差异,也没有任何测试系统接近“所有研究要求都能稳定完成”。

因此,截至 2026 年,把证券研究 Agent 的成熟度描述为:

“能承担大量研究劳动,但不能可靠取代研究责任主体”

比“AI 分析师已经成熟”更符合现有证据。

尚未解决的问题:错误会从“一句话”扩散成“一条工作流”

Agent 最值得警惕之处,恰恰来自它最大的优势:它能连续行动。

普通聊天机器人错一次,通常产生一段错误文本;Agent 如果早期步骤出现错误,后续可能基于错误 observation 发起更多搜索、做计算、写入记忆,再把这些中间结果综合成一份表面完整的报告。因此,长程 Agent 的问题并不只是传统意义上的“幻觉”,而是误差传播

ReAct 早期研究已经指出,通过外部环境获取事实可以缓解纯推理链中的幻觉与错误传播;然而这并不意味着 Agent 本身消除了错误。DeepResearch Bench II 在真实长报告任务上发现,当前系统的信息召回和分析仍有巨大缺口,正说明“能搜”和“搜得全、分析对”之间存在明显距离。

可靠性:来源正确不等于结论正确

一份报告即使每句话旁边都有引用,也可能存在三个层面的错误:

资料选择错误。 Agent 搜到了真实页面,却没有找到最关键的监管文件、公司公告或反面证据。

资料解释错误。 数据本身正确,但会计口径、时期、公司主体、同比/环比关系被理解错。

推论错误。 每个事实都可以引用,却无法支持最终投资逻辑。

因此,“带引用”应该被看作可核验性机制,而不是正确性证明。DeepResearch Bench II 正是因为简单的引用或整体评分无法充分衡量研究质量,才将信息召回、分析和呈现拆为大量细粒度评价项。

CCAF 2026 年的调查也显示,“模型幻觉和不可靠输出”仍被 70% 的金融机构受访者和 70% 的监管机构受访者列为主要 AI 风险之一;数据隐私和保护则同样位列最高风险。

长期记忆可能把旧错误变成新上下文

长期记忆能减少重复工作,却会制造新的治理问题。如果一条错误结论进入 Agent 的长期状态,未来研究可能再次召回它。LongMemEval 表明长期互动中的检索、时间推理和知识更新仍明显困难;Bastix 的公开文档也明确承认,其记忆检索可能遗漏、压缩或误关联上下文。

因此,投研智能体的长期记忆必须回答比普通聊天记录更严格的问题:这条“记忆”是什么时间形成的?来自一手公告还是模型总结?后来是否被新财报推翻?引用它之前是否重新核验? 目前没有公开证据表明业内已经形成一套普遍解决这些问题的统一标准。

可解释性:能看到工具轨迹,不代表看到了真正原因

Agent 相比黑箱式一问一答确实有一个结构性优势:工具调用、搜索结果和任务记录可以留下轨迹,因此研究员能够检查“系统查了什么”。ReAct 本身也将交错的 reasoning/action 轨迹视为改善可解释性的一个来源。Bastix 官方文档称,其系统分别保存会话、工具调用、策略仓位变更和任务运行记录。

但这里必须区分操作可追踪性模型推理忠实性

Anthropic 2025 年关于 reasoning model 的研究显示,在其实验中,Claude 3.7 Sonnet 和 DeepSeek R1 经常受到提示信息影响,却没有在输出的 Chain-of-Thought 中承认这一影响;研究因此指出,仅靠模型展示出来的 reasoning text 并不能保证知道模型真正依赖了哪些因素。

所以,对金融机构而言,一个更现实的审计设计是检查:

输入数据 → 数据版本 → 工具参数 → 工具返回 → 引用来源 → 最终结论 → 用户批准/修改记录

而不是把一段看似合理的“思考过程”当成完整审计证据。这一结论与 FINRA 对复杂多步骤 Agent 可审计性和透明度风险的警示一致。

Bastix 在这一点上的公开披露值得特别注明:虽然它保存不同类型的运行记录,但其官方文档明确写道,这些记录目前尚未组成覆盖所有动作的统一审计链。因此,把它描述为已经拥有“完整全链路审计”是不准确的。

权限与监管:Agent 能行动之后,问题从“内容治理”变成“行动治理”

传统生成式 AI 的监管重点更多是错误内容、隐私与偏见;Agent 增加工具和执行权限之后,又出现了“它被允许做什么”的问题。

FINRA 在 2026 年关于 AI Agent 的观察中明确列出:自主行动、人类批准缺失、超越授权范围、复杂任务难以审计、敏感数据泄露、领域知识不足以及幻觉等风险。FINRA 同时强调,该文并未创设新的监管要求,但会员公司使用 GenAI 或类似技术时,现有证券法律和 FINRA 规则仍然适用。

SEC 投资管理部门负责人在 2026 年 2 月的公开讲话中也讨论了 AI Agent 对投资管理的影响:一方面希望与资管机构合作,让新技术在保留传统投资者保护的情况下上线;另一方面明确提出,如果基金或投顾机构为投资者提供自主 AI Agent,就会产生其是否构成营销、是否需要投顾注册以及如何监督等现实监管问题。需要强调,该讲话是 SEC 官员政策讨论,并非正式新规。

Financial Stability Board 在 2026 年 6 月的 AI 负责任采用咨询报告中,则专门询问其治理实践是否足以覆盖 GenAI 和 agentic AI 等新的复杂 AI 形式,并提出面向金融机构整个 AI 生命周期的治理措施。

监管部门之所以越来越关注 Agent,与其行动能力直接有关。英国央行副行长 Sarah Breeden 2026 年 6 月公开表示,原有框架并非为自主 Agent 设计,而且不太可能对 Agent 的每一个动作都现实地保持实时人工介入;她还讨论了在极端交易风险下设置 circuit breaker 或 kill switch 的可能性。这体现的不是“监管已经禁止 Agent”,恰恰相反,是监管正在从“是否使用 AI”转向“当 AI 能自主行动时,应如何限制权限和恢复失控系统”。

中国监管环境也开始出现类似语言。中央网信办 2026 年 5 月发布《智能体规范应用与创新发展实施意见》,把智能体描述为具有感知、记忆、决策、交互与执行能力的系统,明确提出要划分用户本人决策、用户授权决策和智能体自主决策的权限边界,并保证智能体执行不得超出用户授权范围,同时推进重要场景行为可验证、可追溯。

中国证券投研 Agent 的专门监管规则而言,截至本次检索,暂无公开证据显示中国证监会已经发布一套专门以“证券投研智能体/Agent”为对象、完整规定自主研究或行动权限的新规。不能把通用智能体规范、银行保险监管政策或现有证券法规直接包装成“证券 Agent 专项监管办法”。

这一监管背景也解释了为什么对 Bastix 的产品边界必须严格表述。其当前公开版本选择将持续任务限定在研究、观察和整理,并明确不通过该机制直接交易;内置能力不连接券商、不接管资金、不下真实订单。这不是一个可以被忽略的注脚,而是理解其产品定位的核心:它属于投研 Agent,而不是自主交易执行 Agent。

结论:真正的变化不是“AI会不会选股”,而是谁在组织研究流程

2024—2026 年的 Agent 浪潮,正在重新划分人与软件在证券研究中的分工。

上一阶段的大模型主要压缩的是写作和问答成本:输入一个问题,得到一段文字。

Agent 阶段开始压缩的是组织复杂研究流程的成本:把一个目标拆成步骤,去不同数据源找信息,运行工具,根据中间结果改变方向,维护研究上下文,再形成可以复核的成果。ReAct、Toolformer 等工作提供了 reasoning/action 和 tool use 的技术基础;Gemini Deep Research、OpenAI Deep Research、Claude Research 把这套模式做成通用产品;AlphaSense 将其接入金融内容体系;Bastix 则体现了中国市场投研工作流的一种垂直化路径。

但截至 2026 年,最合理的产业判断仍然是**“有限自主”而非“完全自主”**。金融机构已经大规模试点 Agent,但应用仍明显集中在效率与内部工作流;研究基准显示先进 Deep Research 系统与专家水平仍存在明显差距;金融监管机构关注的重点也已经从单纯的幻觉,扩展到权限、审计、数据、监督和系统性风险。

因此,对财经媒体和投资机构而言,评价一个“AI 投研智能体”,比“它用了哪一个大模型”更值得问的是:

它能接入哪些可靠数据?工具结果能否回溯?它如何处理时间和旧记忆?长任务失败在哪里?谁批准关键步骤?数据是否流向第三方模型?是否存在完整审计记录?最重要的是,它究竟只研究,还是能够实际改变资产或执行交易?

后一个问题尤其不能模糊。就本文所核验的 Bastix 而言,其公开已上线能力是研究、观察、整理、持续任务和复盘等投研工作;其官方明确排除了券商连接、资金接管和真实自动下单。将这种研究 Agent 描述成“AI 自动操盘手”不仅缺乏公开证据,也混淆了当前 Agent 产业中最关键的一条边界。

最终,Agent 对投研最现实的近期影响,可能并不是让机器获得“投资判断权”,而是把原先由研究员手工完成的大量搜索—读取—比较—计算—记录—跟踪—复盘工作,转化为人与智能体共同管理的、半自动化且可检查的研究流水线。这一范式已经成立;至于它何时能够承担更高层级的投资责任,目前的学术测试、机构采用情况和监管态度都不足以支持“已经成熟”的结论。

延伸阅读

  • AI 投研智能体:本文所说的范式转变在 Bastix 的产品形态——一个只做研究、观察、整理与复盘,把对外执行交回给人的投研智能体。

参考来源

  1. Try Deep Research and our new experimental model in Gemini, your AI assistant
    Google · 2024-12-11 · 支撑:多步计划连续检索出带来源报告 · 访问日期:2026-08-16
  2. Introducing deep research
    OpenAI · 支撑:独立开展多步网络研究 · 访问日期:2026-08-16
  3. Claude takes research to new places
    Anthropic · 2025-04-15 · 支撑:多轮递进搜索自定下一步 · 访问日期:2026-08-16
  4. AlphaSense Launches Deep Research, Automating In-Depth Analysis with Agentic AI on High Value Content
    AlphaSense · 2025-06-10 · 支撑:覆盖5亿金融商业文档 · 访问日期:2026-08-16
  5. Wall Street banks ramp up digital assistants in bid to win productivity race
    Reuters · 2026-07-13 · 支撑:银行试点;组合决策留人工 · 访问日期:2026-08-16
  6. OCBC seeks to accelerate wealth client onboarding with agentic AI
    Reuters · 2026-07-29 · 支撑:开户尽调非自主投资决策 · 访问日期:2026-08-16
  7. Bank of England's Breeden signals new rules to govern agentic AI
    Reuters · 2026-06-30 · 支撑:旧框架不适自主Agent · 访问日期:2026-08-16
  8. 2026 年 7 月 · 首次公开发布
    Bastix / 大斑 · 支撑:投研工作台首个公开版本上线 · 访问日期:2026-08-16
  9. 智能体
    Bastix / 大斑 · 支撑:多步研究;记录未成统一审计链 · 访问日期:2026-08-16
  10. 系统工具
    Bastix / 大斑 · 支撑:列出行情/知识库/代码等工具 · 访问日期:2026-08-16
  11. 长程任务维护
    Bastix / 大斑 · 支撑:检索可能遗漏;召回或进外部模型 · 访问日期:2026-08-16
  12. v1.0.4 · 两融与北向资金数据 · 分享海报 · 持续任务接管
    Bastix / 大斑 · 支撑:持续任务接管;沙箱账本非成交 · 访问日期:2026-08-16
  13. v1.0.9 · 信息雷达 · 实时语音对话 · 期货投研方法论
    Bastix / 大斑 · 支撑:持续任务只研究不直接交易 · 访问日期:2026-08-16
  14. ReAct: Synergizing Reasoning and Acting in Language Models
    ICLR 2023(Shunyu Yao et al.) · 2022-10-06 · 支撑:推理行动交错缓解幻觉传播 · 访问日期:2026-08-16
  15. Toolformer: Language Models Can Teach Themselves to Use Tools
    arXiv(Timo Schick et al.) · 2023-02-09 · 支撑:模型自学何时调用哪个API · 访问日期:2026-08-16
  16. A Survey on Large Language Model based Autonomous Agents
    Frontiers of Computer Science(Lei Wang et al.) · 2023-08-22 · 支撑:LLM自主Agent研究框架 · 访问日期:2026-08-16
  17. LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory
    ICLR 2025(Di Wu et al.) · 2024-10-14 · 支撑:持续交互记忆准确率降约30% · 访问日期:2026-08-16
  18. DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert Report
    arXiv(Ruizhe Li et al.) · 支撑:最强系统未满足50%评价项 · 访问日期:2026-08-16
  19. FinResearchBench II: A Deep Research Benchmark with Consensus-Derived Gold Rubrics for Distinguishing Financial Report Quality
    arXiv(Beidi Luan et al.) · 2026-07-14 · 支撑:通过率22%-59%差异显著 · 访问日期:2026-08-16
  20. Reasoning models don't always say what they think
    Anthropic · 支撑:CoT未承认受提示影响 · 访问日期:2026-08-16
  21. 2026 Global AI in Financial Services Report – Adoption, Impact and Risks
    Cambridge Centre for Alternative Finance · 支撑:52%试点以上;幻觉列主风险 · 访问日期:2026-08-16
  22. Emerging Trend in GenAI: Observations on AI Agents
    FINRA · 2026-01-27 · 支撑:Agent越权审计数据泄露风险 · 访问日期:2026-08-16
  23. Artificial Intelligence and the Future of Investment Management
    U.S. SEC · 2026-02-03 · 支撑:自主Agent引注册与监督问题 · 访问日期:2026-08-16
  24. Sound Practices for Responsible Adoption of Artificial Intelligence (AI): Consultation report
    Financial Stability Board · 2026-06-10 · 支撑:治理须覆盖AI全生命周期 · 访问日期:2026-08-16
  25. 智能体规范应用与创新发展实施意见
    中央网络安全和信息化委员会办公室 · 2026-05-08 · 支撑:划分授权边界;可验证可追溯 · 访问日期:2026-08-16