Bastix
Insights

从一次性快照到持续过程:AI投研如何转向可积累、可交接的研究系统

AI投研正从「一次性快照」转向「持续过程」——研究对象从一篇报告变成随交易日和新证据不断演化的状态机,真正门槛是记忆、调度、回溯、可审计四件事连成闭环。Bastix 是只做研究、不下单、不连券商、不承诺收益的投研智能体,其长程/持续任务只做研究、观察与整理,并如实披露长程记忆可能遗漏与外部模型数据边界。

执行摘要

过去一轮生成式 AI 在投研中的主流用法,本质上仍沿袭了传统研究报告的时间范式:在某个时点 t_0,把当时可得的信息压缩成一份答案或报告。这种“一次性快照”很适合查数、摘要、财报点评、初步行业梳理,也已经在知识工作中证明具有显著的提效价值;但当任务变成“未来数周、数月持续验证一个投资假设”,核心问题便不再是“这一次回答得好不好”,而是系统能不能记住上一次发生了什么、知道下一次什么时候继续、区分新旧状态、发现错误后回到原始证据,并把整个过程交给另一个人继续。金融机构近期的公开实践也越来越把 AI 从报告生成推向研究框架、信号处理、风控、复盘和可回溯工作流。

这意味着投研正在发生一次比“用不用 AI”更深的时间范式转变

一次性快照范式 A持续过程范式 B
研究单位是“一份报告/一轮问答”研究单位是“一个跨交易日持续存在的任务”
优化某一时点答案质量优化跨时点状态的一致性、更新能力与恢复能力
上下文主要存在于当前窗口研究状态被持久化、分层记忆并按需召回
未来事件靠研究员自己记得再来问日历、交易日或条件触发下一轮研究
修改往往意味着重新生成新证据作为状态变更追加,可比较前后版本
交付物主要是结论交付物还包括证据、假设、待验证条件、变更历史和责任记录
失败常表现为“这次答错”失败还可能表现为“错误被记住并在未来反复继承”

学术研究已经为这种变化提供了相当清晰的技术轮廓。2023 年的 Generative Agents 把长期智能体拆成“观察—记忆—反思—规划”,并将经验持续存储、抽象和检索;MemGPT 则把长时记忆问题类比为操作系统的分层内存管理;Reflexion 证明“复盘结果进入下一轮记忆”本身可以成为智能体改进行为的机制。

但“能持续运行”绝不等于“能可靠自治”。LongMemEval 显示,在持续交互历史中,现有记忆系统面对信息抽取、跨会话推理、时间推理、知识更新和应当拒答等能力仍有明显退化;2026 年 Memora 更进一步发现,长时程智能体会频繁重新使用已经失效的旧记忆,随着时间跨度和状态变更增加,这种问题可能加重。

因此,本文的中心判断是:**下一阶段 AI 投研的竞争重点,不只是模型在某一次问答中的“智力”,而是研究状态能否在时间中可靠地被维护。**真正的门槛是四件事连成一个闭环——记忆、调度、回溯、可审计性。没有记忆,任务无法积累;没有调度,任务仍需人工不断唤醒;没有回溯,错误无法定位;没有审计,持续自动化反而会放大责任与合规风险。NIST 的 AI 风险管理框架明确把风险管理描述为贯穿整个生命周期的持续、迭代过程;FINRA 对金融机构生成式 AI 的监管关注也包括持续监控、保存提示与输出日志、记录模型版本以及人工复核。

需要首先划清一条边界:**“持续过程”并不等于“自动交易”。**在证券研究这种高风险场景,合理的落地路径更接近“长期研究单元”:机器持续搜集、整理、比较、提醒和维护研究状态,但资本配置、真实交易以及受监管的投资意见仍需明确的人类责任边界。上海证券报对券商智能体实践的报道中,多位从业者也将 AI 描述为“辅助驾驶”而非“自动驾驶”;FINRA 则把缺少人工验证和批准的自主行为直接列为智能体风险之一。

为什么“一次性分析”不够:从“答案”转向“研究状态”

一次性分析的问题并不是“报告没有价值”,而是报告这种对象天然更擅长描述一个时点,而投资研究关心的是一个不断变化的世界。企业经营数据会更新,财报会发布,政策、价格、竞争格局和市场预期都会变化;一条投资逻辑通常包含“目前成立的事实”“仍待确认的假设”“未来需要等待的催化剂”“一旦出现就应否定原判断的反证”。近期公开的金融 AI 产品与机构实践,已经明显开始强调常态化监测、版本回溯、增量信息更新以及把研究判断沉淀为可迭代系统,而不是只把 AI 当作一次性的报告生成器。

可以把一次性研究抽象成:

R_t = f(D_{≤t}, A_t)

其中 R_t 是时点 t 的报告,D_{≤t} 是截至当时的数据,A_t 是当时采用的假设。问题是,到 t+1 时,系统如果只拥有 R_t 这篇文本,而不知道其中每条结论对应什么证据、什么假设仍有效、什么事件等待验证,就只能重新“读一遍、想一遍”。**文本可以保存,研究状态却没有被显式保存。**长期记忆研究正因此把“存什么、如何索引、何时检索、如何处理更新”视为独立系统问题,而非简单把全部历史塞进更长上下文。LongMemEval 将长期记忆拆成索引、检索和读取三个阶段;MemGPT 也明确提出分层管理超出上下文窗口的信息。

过程范式则更接近:

S_{t+1} = U(S_t, E_{t+1})

这里的核心对象不再是报告 R,而是研究状态 S:当前投资假设、证据集合、反证、关注指标、待触发事件、策略状态、置信度、未决问题以及历史版本。新事件 E_{t+1} 到来后,系统不是从零再写一篇报告,而是判断“哪些状态需要修改,哪些保持不变”。这正是“从 A 到 B”的第一层变化:从重新生成全文,到维护一个有状态的研究对象。 Generative Agents 中“记录经验—形成更高层反思—动态检索用于规划”的设计,就是这一思想在智能体领域的早期代表。

第二层变化,是从“现在给结论”到“把未来条件变成任务”。一次性模型天然倾向于在当前回复里收束问题,而真实投研经常需要说:“现在证据不够;等下一次财报、价格条件、政策事件或经营指标出现后再判断。”把这种“暂不下结论”真正工程化,需要能够保存未决状态,并在未来时点重新启动。通用 AI 产品已经公开上线“指定时间执行”和“周期性执行”的 Scheduled Actions;企业软件厂商也开始把能以较少人工干预完成例行任务的自主智能体作为工作流产品推广。

第三层变化,是从个人脑内上下文到可交接的组织资产。报告可以告诉接手者“我们最后怎么看”,但未必告诉他“为什么删掉了另一个假设”“哪条数据推翻了上一版判断”“下一次检查点是什么”。财联社对 2026 年金融 AI 投研实践的报道中,受访机构已经把“推演过程留痕、可回溯、可审计”和“把判断沉淀为可持续进化系统”作为重要方向;上海证券报报道的部分券商实践,也开始把自动化对象定义成整个研究生产过程,而最终评级仍由持牌分析师负责。

更重要的是,“让 Agent 多运行几个小时”本身并不能完成这种范式转变。TheAgentCompany 模拟真实数字工作环境的基准,在其 2025 年更新版本中,表现最好的基线智能体可自主完成约 30% 的任务,同时论文仍认为更困难的长时程工作明显超出现有系统可靠能力。METR 也专门用“任务完成时间跨度”衡量智能体可靠性,并明确指出 time horizon 指的是“以人类专家完成时间衡量的任务难度,在某一成功概率下对应的跨度”,不是模型实际不停运行了多久。换言之,长时程是一种独立的可靠性维度,而不是单次能力分数的自然外推。

所以,一次性分析真正缺少的,不是“更多文字”,而是四种过程能力:过去可以被正确记住,未来可以被可靠唤醒,变化可以被回滚解释,过程可以由第三方审计。

过程范式的技术门槛:从“更长上下文”转向“可维护系统”

记忆首先不是“把聊天记录全部保存下来”。 长期研究需要至少区分几类信息:当前任务临时使用的工作记忆;逐次事件形成的情景记忆;从多次观察中抽象出的研究结论或语义记忆;以及不应被模型自由改写的原始文件、公告、财务数据等外部证据。Generative Agents 强调经验记录、反思和按相关性检索;MemGPT 强调分层内存;LongMemEval 则说明,即便历史“都在”,索引、检索和读取设计不佳仍会显著降低准确性。

更棘手的是,金融记忆必须支持失效与修订。传统 RAG 的隐含目标往往是“找到过去相关的信息”;长时程投研还必须回答“这条过去的信息现在还有效吗”。Memora 专门引入“遗忘感知”的评估:在周、月、季度级模拟交互中,它发现模型和记忆智能体会使用已被更新或作废的记忆;对记忆智能体而言,随着时间线变长,对应的遗忘惩罚反而上升,论文据此强调遗忘、整合和状态变更必须成为长期记忆的一等机制。

调度则把“记得以后再看”变成系统行为。 通用 Scheduled Actions 已经证明用户可以把一次提示转成指定时间或重复执行的动作;但股票投研比普通日历提醒多一层工程要求:系统需要理解交易日、盘前/盘中/盘后等时序,并可能根据条件而不是单纯时钟触发。后一句属于本文基于金融场景的工程推论,并非某项统一行业标准。

一个可靠调度器也不只是“闹钟”。在过程系统中,同一任务不能因为重启或网络抖动被重复执行两次;失败需要重试但又不能造成重复状态更新;每次运行应产生唯一记录;任务被暂停、修改和恢复之后仍应知道自己处于哪个版本。换句话说,调度真正触发的不是一段 prompt,而是一次受控的“状态转换”。NIST 对部署后 AI 的管理建议同样强调持续监控、变更管理、故障恢复、事件响应与文档化。

回溯能力解决“错了以后怎么办”。 单次问答里,常见补救方法是“重新问一次”;长程系统如果此前错误已经进入研究记忆,后续的观察、筛选甚至复盘都可能以它为前提,因此必须能够回答:错误首次在哪一天进入系统?来自哪条来源?哪些后续状态依赖它?需要从哪个检查点重新计算?NIST 明确建议记录部署前后性能差异,并在观察到异常时考虑误差传播与反馈回路风险。

可审计性也不应等同于“把模型的思维链展示出来”。 对金融系统而言,更稳定、可操作的审计对象是可观察事实:输入是什么,引用了哪些来源,调用了哪些工具,使用了哪个模型版本,生成了什么输出,系统状态发生了什么变化,谁进行了人工复核,最后谁批准了行动。FINRA 2026 年监管报告直接建议持续监控提示、回复和输出,可保存 prompt/output 日志用于问责和故障排查,并跟踪“何时使用了哪个模型版本”和人工验证情况。

四个技术组件可以这样理解:

技术组件一次性快照范式持续过程范式所需能力最小可用设计核心失败模式
记忆类型当前上下文、最终报告工作记忆+事件记忆+抽象研究状态+原始证据;带时间、版本和有效性对每个事实保存来源、时间戳、状态;旧结论可 supersede 而非静默覆盖召回遗漏、错误关联、旧事实被当成当前事实。LongMemEval 与 Memora 均显示长期历史中的此类脆弱性。
调度方式用户手工重新发起定时、周期、交易日与条件触发;任务暂停/恢复;幂等与失败处理每次运行唯一 ID+明确下一触发条件+运行状态漏跑、重复跑、旧计划恢复后误触发;通用产品已经上线周期性 Scheduled Actions。
回溯机制重新生成、人工翻聊天状态快照、追加式事件、版本 diff、从检查点重算“前状态—证据—动作—后状态”四联记录错误进入状态后无法确定影响范围;NIST 特别提示误差传播和反馈回路风险。
可审计性最终文本+少量引用来源、工具调用、模型版本、时间、输入输出、状态变更与人工审批可导出的运行日志和证据链结果看似稳定,但无法证明当时“为什么这样判断”;FINRA 强调日志、版本追踪、人工验证与完整文档。

这里有一个关键工程规律:四者不是独立功能,而是串联关系。 调度器唤醒的是某一版记忆;记忆改变形成新的状态;新状态必须能够回到旧状态;所有这些动作又必须被记录。只做其中任何一项都很容易得到“看起来一直在工作”的系统,却得不到真正可交接的长期研究过程。

从风险管理角度看,这也解释了为什么 NIST 将 AI 管理定义为生命周期内持续、及时、迭代的活动,并要求部署后的系统继续监测性能退化、异常、漂移、near-miss 与变化后的风险。

落地形态与案例:从“AI问答”到“长程研究单元”

公开产品的发展已经出现三个相互关联的形态。第一类是通用定时 Agent:Google 在 2025 年上线 Gemini Scheduled Actions,让一次提示可以在指定时间执行或转成周期动作;微软则向企业客户推进处理客户咨询、销售线索、库存等例行事务、减少人工干预的智能体。

第二类是长期研究工作台。时代财经 2026 年 7 月报道,AI 进宝上线研究模式,公开功能包括独立长期研究空间、信息自动归档、人机协作撰稿、批注与版本回溯,以及针对研究标的设置常态化监测任务,在原研究底稿上持续加入增量信息;其任务模式还公开支持周期性监测、数据对比、舆情扫描和财报复盘。需要强调的是,该报道中关于行业普及率的若干调查数字没有在文章中给出足够透明的方法细节,本文不采用这些数字作为论据。

第三类是机构化研究生产线。上海证券报 2026 年 8 月报道,国泰海通 NovaStation 已上线多个专项智能体和投研 Skills;招商证券国际则将高股息研究流程改造成可审计、可复核的自动化研究生产线,但最终结论与评级仍由持牌分析师签署负责。这说明“自动化研究流程”和“机器替代最终责任主体”是两件不同的事。

TAP 长程投资任务案例。 按本报告给定的案例名称,下文称其为 “TAP 长程投资任务”。需要先做一个来源校正:在本次检索到的 Bastix / 大斑 官方公开页面中,可以直接核验“长程投资任务/持续任务”以及“研究 → 观察 → 持仓 → 复盘”的阶段设计,但没有检索到“TAP”这一英文缩写的官方全称或公开定义,因此“TAP”这一缩写本身暂无公开证据,本文只把它作为案例标签使用。官方 v1.0.5 更新明确写明:智能体会把投资想法视为跨时段长任务,先判断所处阶段及时间轴,把当下能完成的工作完成,把依赖未来时点或条件的部分留待触发,并持续记录各阶段事件以连接跨轮次、跨计划上下文。

其公开流程可以结构化重绘为:

flowchart LR
    R["研究<br/>形成假设、证据与反证"] --> O["观察<br/>等待交易日、事件或条件变化"]
    O --> P["持仓<br/>记录策略仓位/研究状态<br/>非真实券商成交"]
    P --> V["复盘<br/>比较预期与结果、更新规则"]
    V --> R

    O -. "条件尚未满足" .-> O
    R -. "未来检查点" .-> O
    V -. "修订假设" .-> R

这张图最重要的不是四个名词,而是“允许暂不作答”:公开文档称,需要等未来时点或条件成立的部分会被规划后留待触发,而不是强行在一轮里凑出结论;同一个智能体还可以并行拥有盘前扫描、盘中跟踪、收盘复盘等相互独立的持续任务计划。

从公开已上线能力看,Bastix / 大斑 已公布持续任务运行记录、长程任务上下文、沙箱策略仓位以及交易日定时信息雷达等机制。v1.0.9 明确称官方信息雷达可在每个交易日从盘前到盘后无人值守定时扫描公告与资讯;同时又明确收紧持续任务的权限,使定时持续任务只做研究、观察与整理,需要对外执行的动作回到用户在场的主会话,并写明“持续任务不用于直接交易”。

这里的“持仓”也必须精确理解。公开能力文档把策略仓位定义为独立的沙箱账本,保存目标仓位、当前仓位和变更历史,但明确说明它不是券商账户持仓,不包含能够证明真实下单、成交或滑点的信息。也就是说,它更像一种研究状态:让后续观察和复盘知道“这个研究假设当时对应什么策略状态”,而不是让 Agent 成为真实交易主体。

公开边界同样明确:Bastix / 大斑 内置能力不连接券商、不接管资金、不代替用户下真实订单;产品只在决策与研究层工作,并明确“不承诺收益”,其分析与建议仅供参考、不构成投资意见。官网还称产品“不构成投资或交易推荐”;因此,按照本报告所要求的表述,可以将其归纳为不自动下单、不连券商、不荐股、不承诺收益

这并不意味着模型输出不会出错。相反,Bastix / 大斑 公开文档主动列出的已知限制包括:长程记忆检索可能遗漏、压缩或误关联上下文,不保证完整保留全部历史,也不保证每次准确召回;其“可信度治理”核查同样由模型辅助完成,范围限于当前轮次可用来源,明确“不等于最终事实结论”。其“边界与原则”页面还写明,目前尚未承诺覆盖所有动作的统一审计链。换言之,这个案例本身反而说明:长程能力与完全可靠、完全可审计之间仍存在距离。

因此,TAP 长程投资任务更准确的定位应是持续研究单元,而非自动交易系统:它把“研究—观察—策略状态—复盘”变成可以跨交易日维护的对象,但真实资本行动仍在系统能力边界之外。模型可能出错,任何输出均不能替代原始资料核验,也不构成投资建议。

公开能力横向比较如下。表中的“暂无公开证据”不是“否”,只表示本次检索未找到足以核验该能力的可靠公开来源。

系统名公开能力是否自动下单是否连券商备注/来源链接
Bastix / 大斑——TAP 长程投资任务投研智能体;长程/持续任务;研究→观察→持仓→复盘;多持续计划;交易日信息雷达;研究上下文;沙箱策略仓位;运行记录;回复核查否,官方明确否,官方明确持续任务只做研究、观察、整理;策略仓位不代表真实成交;不构成投资/交易推荐,不承诺收益。
AI进宝研究模式独立长期研究空间;信息归档;协同撰稿;批注留痕;版本回溯;常态化监测;周期性任务;财报复盘暂无公开证据暂无公开证据公开报道聚焦研究工作台和任务模式,没有足够来源证明存在真实自动交易或券商连接。
国泰海通 NovaStation多个专项智能体、30 余个投研 Skills,面向研究流程提供能力暂无公开证据暂无公开证据报道可证明其研究能力,不足以证明是否直接发起交易。
招商证券国际高股息实战 AI 原生投研 2.0 执行系统把主动选股研究改造成可审计、可复核的自动化研究生产线;最终结论与评级由持牌分析师签署暂无公开证据暂无公开证据“自动化生产线”在来源中指研究生产过程,不能据此推断为自动下单。

这组案例透露出一个值得关注的产业信号:**从“聊天机器人”到“过程系统”的过渡,最先出现的往往不是全自主交易,而是对重复研究活动的长期化——定时扫描、增量整理、维护底稿、记录状态、复盘和人工签署。**这既符合当前模型的能力边界,也更接近金融监管对持续监督和人类责任的要求。

长时程风险:从“单点误差”转向“轨迹风险”

一次性分析的错误通常容易理解:一个数字错了、一个逻辑跳步了、一个来源不存在。进入持续过程后,风险发生了结构性变化——错误本身会获得时间维度。错误可能被写入记忆,被下一轮检索出来,被新的分析当作已知事实,再被压缩成更高层结论,最后甚至在复盘时成为解释历史的依据。

第一类是错误累积。最直观的数学示意是:假设一个由 n 个必要阶段构成的任务,每阶段独立成功概率均为 p,那么全部阶段均正确的概率是 p^n。这只是帮助理解的理想化公式,并非现实智能体的实测模型;现实中各步骤还会相互依赖。不过 2026 年的长时程评估研究特别提醒,不能把“任务越长越容易失败”简单全部归因于误差复利:更长任务同时意味着更多普通失误机会、更难的局部决策、更多上下文和工具输出以及环境变化。严谨评估应把完整轨迹表现与匹配的短阶段基线比较,才能识别真正由轨迹造成的额外退化。

这点非常重要,因为它避免了一种常见夸大:**“长任务失败”并不自动证明 Agent 存在某种神秘的长期推理崩溃。**有时只是任务步骤更多;有时才是真正的状态污染导致后续越来越难。因此,过程型投研系统不仅要测“最终任务做没做完”,还应该测每一个阶段的局部正确率、状态恢复率、旧信息失效率以及错误从哪一步开始影响后续。

第二类是状态漂移。这里至少应区分三种“漂移”。其一是外部世界发生变化:公司经营和市场环境已不同于建立研究假设时。其二是内部记忆漂移:系统仍能检索到旧状态,却没有正确理解它已经被新信息推翻。其三是系统本身变化:模型版本、数据源、提示、检索算法或工具升级后,同样的研究任务可能产生不同结果。NIST 将生产环境随时间变化导致原始设计假设不再成立的现象直接纳入 drift 监控,并建议比较部署前后指标、监控数据分布变化及误差传播。

其中最容易被低估的是第二种。Memora 的结果表明,长期记忆的困难不只在于“存不下”,而在于能否维持连贯、当前有效的状态;论文发现长期记忆智能体会越来越依赖本应被修订或丢弃的信息,并指出单纯保留更多旧记忆可能放大不一致。换言之,“永不遗忘”对于过程型智能体不是优点,反而可能是一种缺陷。

第三类是不可回溯风险。设想三个月后某个研究判断被证明严重错误,仅仅保存“三个月的对话”远远不够。真正的回溯需要知道:当时用了哪一版数据;哪条公告或研报进入上下文;模型和工具是什么版本;哪一个中间结论改变了研究状态;后来哪些输出继承了它;有没有人工覆盖过结果。FINRA 将模型版本、提示与输出日志、人工验证及完整文档列为持续治理内容;NIST 也强调部署后测试、根因分析、漂移、near-miss、故障与事件响应的记录。

第四类是**“连续性制造的虚假可信感”。一次错误回答往往容易引起警觉;一个每天自动更新、能够引用自己过去结论、表面上非常一致的系统,却可能让人产生“它一直在跟踪,所以一定更可靠”的心理错觉。Memora 的结果给出了一个技术层面的原因:系统完全可能因为重复调用同一份过时记忆**而表现得高度一致,但一致并不等于正确。

金融领域对此尤其敏感。FSB 将模型风险、数据质量和治理列为金融业采用 AI 可能带来的重要脆弱性,并持续要求监管机构加强对 AI 使用与相关风险的监测;FINRA 也明确讨论幻觉、过时数据造成的概念漂移、自治程度和人工监督问题。

下面的风险时间轴是一个机制示意,不代表实测概率

flowchart LR
    T0["T0 研究初始化<br/>风险:错误前提/错误来源"]
    T1["T1 交易日观察<br/>风险:漏检、误检、旧记忆召回"]
    T2["T2 状态更新<br/>风险:新旧事实未正确替换"]
    T3["T3 后续持续任务<br/>风险:错误状态被重复继承"]
    TN["Tn 复盘<br/>风险:无法定位起点、事后合理化"]

    T0 --> T1 --> T2 --> T3 --> TN

    C0["检查点<br/>原始来源+基线状态"] -.-> T0
    C1["检查点<br/>时间戳+有效期+反证"] -.-> T1
    C2["检查点<br/>版本 diff+状态变更记录"] -.-> T2
    C3["检查点<br/>阶段复核+异常暂停"] -.-> T3
    C4["检查点<br/>完整运行日志+人工签署"] -.-> TN

这张图揭示过程范式的一条核心原则:时间越长,系统越需要“主动制造断点”。 一个优秀的长期智能体不应该只是“永远继续”,而要能够在关键节点暂停、重新核验原始来源、使旧记忆失效、对比前后版本、必要时回滚到某个已知可靠状态。NIST 关于持续监控、根因分析和 change management 的建议,以及长期记忆研究关于更新和遗忘的结果,都支持这种设计方向。

因此,四项最低控制应与四项能力一一对应:**记忆必须带“来源、时间、有效性”;调度必须带“唯一运行记录和异常状态”;回溯必须保存不可静默覆盖的版本历史;审计必须能回答“谁、何时、使用什么模型和数据、做了什么状态变更”。**这不是为了把 AI 变得官僚化,而是因为一旦研究从一次性输出变成持续运行的基础设施,系统的“恢复能力”就和生成能力一样重要。

结论:从“生成报告”转向“经营研究状态”

投研的下一次范式转变,不宜被概括成“AI 会写更好的研报”。更准确的说法是:研究对象正在从一篇文档,变成一个随交易日和新证据不断演化的状态机。

从 A 到 B,变化发生在六个层面:

从报告到任务。 一次研究不再天然以“交稿”为结束,而可以保持开放,等待未来数据和事件。金融行业近期公开实践已经出现长期研究空间、周期任务、自动化研究生产线和复盘环节。

从上下文到记忆系统。 “模型能读多少 token”与“系统能否知道某条信息已经失效”是不同问题。LongMemEval 和 Memora 表明,长期记忆真正困难的部分包括跨会话推理、知识更新、时间一致性以及正确遗忘,而不仅是存储容量。

从人工唤醒到可控调度。 通用 AI 已经开始把提示转成周期执行动作;在投研中,这进一步要求围绕交易日、阶段和事件管理下一次研究,而不是让研究员自己记住“过几天回来再问”。

从覆盖修改到版本演化。 当旧结论被新证据推翻,系统不应简单把旧文字删掉,而应留下“为什么改变”的轨迹。否则所谓“长期记忆”最终只会变成越来越大的、真假混杂的档案库。长期记忆研究对 obsolete memory 的结果正说明了这一风险。

从解释结果到审计过程。 金融场景中,可信度最终不能建立在“Agent 说自己为什么这么想”,而要建立在来源、输入输出、工具调用、模型版本、状态变更和人工责任可以被外部复核。FINRA 与 NIST 的公开框架都把日志、持续监控、文档和人工验证放在核心位置。

从“自动化”到“人机分权”。 越是长时程、高影响的系统,越不能把“机器持续工作”偷换成“机器获得最终决策权”。当前公开的金融实践更现实的方向,是让 AI 承担高频的信息处理、研究维护和过程记录,而把战略判断、异常处理、正式评级与资本行动留在明确的人类责任链中。上海证券报报道中的“辅助驾驶”定位、FINRA 对自主 Agent 的风险提示以及 FSB 对模型风险和治理问题的关注,都指向这一边界。

所以,判断一个“长程投研 Agent”是否真正完成了时间范式升级,可以问一个比“它能不能每天自动跑”更严格的问题:

三个月后换一个研究员接手,他能否知道这个系统起初相信什么、后来发生了什么、为什么改变判断、哪些旧信息已经作废、下一次要等什么,以及任何一条关键结论究竟来自哪里?

如果答案是否定的,那么它只是把一次性快照重复了很多次

如果答案是肯定的,研究才真正从“生成结果”进入“持续过程”:**今天的分析成为明天的状态,明天的新证据能够修订今天,而每次修订都可以被下一位研究者理解、验证和接管。**这才是从「一次性快照」到「持续过程」的实质。

延伸阅读

  • 长程投资任务:本文所说的"经营研究状态"在 Bastix 的落地——跨交易日持续推进、进度可查可续的长程投研任务。

参考来源

  1. AI投研走到哪一步?从"工具"到"同事",资产管理机构开始重构投研体系
    财联社 · 2026-08-09 · 支撑:资管机构重构投研体系,强调可回溯审计 · 访问日期:2026-08-16
  2. 从试验场走向主战场 券商加码布局AI智能体
    上海证券报 · 2026-08-08 · 支撑:券商AI辅助驾驶,持牌分析师签署负责 · 访问日期:2026-08-16
  3. 智能投研进入长效工作台时代!进门AI进宝重磅上线研究模式
    时代财经 · 2026-07-24 · 支撑:长期研究空间、版本回溯与常态化监测 · 访问日期:2026-08-16
  4. Plan ahead with scheduled actions in the Gemini app
    Google · 2025-06-06 · 支撑:一次提示可转为定时或周期执行动作 · 访问日期:2026-08-16
  5. Microsoft to let clients build AI agents for routine tasks from November
    Reuters · 2024-10-21 · 支撑:微软让客户构建处理例行任务智能体 · 访问日期:2026-08-16
  6. 面向交易研究与决策的智能体工作台
    Bastix / 大斑 · 支撑:投研智能体工作台,不构成投资交易推荐 · 访问日期:2026-08-16
  7. v1.0.5 · 微信扫码登录 · 联网检索更聚焦 · 智能体分阶段规划
    Bastix / 大斑 · 支撑:投资想法作跨时段长任务分阶段规划 · 访问日期:2026-08-16
  8. v1.0.9 · 信息雷达 · 实时语音对话 · 期货投研方法论
    Bastix / 大斑 · 支撑:信息雷达定时扫描;持续任务不直接交易 · 访问日期:2026-08-16
  9. 长程任务维护
    Bastix / 大斑 · 支撑:策略仓位为沙箱账本,非真实成交 · 访问日期:2026-08-16
  10. 边界与原则
    Bastix / 大斑 · 支撑:不连券商、不下单、不承诺收益 · 访问日期:2026-08-16
  11. 可信度治理
    Bastix / 大斑 · 支撑:核查由模型辅助,不等于最终事实结论 · 访问日期:2026-08-16
  12. Generative Agents: Interactive Simulacra of Human Behavior
    arXiv(Joon Sung Park et al.) · 2023-04-07 · 支撑:观察-记忆-反思-规划,经验存储与检索 · 访问日期:2026-08-16
  13. MemGPT: Towards LLMs as Operating Systems
    arXiv(Charles Packer et al.) · 2023-10-12 · 支撑:长时记忆类比操作系统分层内存管理 · 访问日期:2026-08-16
  14. Reflexion: Language Agents with Verbal Reinforcement Learning
    arXiv(Noah Shinn et al.) · 2023-03-20 · 支撑:复盘进入记忆成为智能体改进机制 · 访问日期:2026-08-16
  15. LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory
    arXiv(Wu et al.) · 2024-10-14 · 支撑:长期交互记忆多项能力明显退化 · 访问日期:2026-08-16
  16. From Recall to Forgetting: Benchmarking Long-Term Memory for Personalized Agents
    arXiv(Md Nayem Uddin et al.) · 2026-04-01 · 支撑:长时程重用失效旧记忆,遗忘惩罚上升 · 访问日期:2026-08-16
  17. Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance
    arXiv(Chao Peng et al.) · 2026-07-01 · 支撑:长任务退化需与短基线对比识别 · 访问日期:2026-08-16
  18. TheAgentCompany: Benchmarking LLM Agents on Consequential Real World Tasks
    arXiv(Frank F. Xu et al.) · 2024-12-18 · 支撑:最佳基线自主完成约30%任务 · 访问日期:2026-08-16
  19. Task-Completion Time Horizons of Frontier AI Models
    METR · 2026-05-08 · 支撑:任务完成时间跨度衡量智能体可靠性 · 访问日期:2026-08-16
  20. AI Risk Management Framework Core
    NIST · 支撑:风险管理贯穿全生命周期持续迭代 · 访问日期:2026-08-16
  21. AI RMF Playbook — Manage
    NIST · 支撑:持续监控、变更管理、故障恢复与文档 · 访问日期:2026-08-16
  22. AI RMF Playbook — Measure
    NIST · 支撑:部署前后差异、误差传播与漂移监控 · 访问日期:2026-08-16
  23. 2026 FINRA Annual Regulatory Oversight Report — Gen AI
    FINRA · 2026-01-01 · 支撑:日志、模型版本追踪与人工验证 · 访问日期:2026-08-16
  24. The Financial Stability Implications of Artificial Intelligence
    Financial Stability Board · 2024-11-14 · 支撑:模型风险、数据质量与治理为脆弱性 · 访问日期:2026-08-16
  25. Monitoring Adoption of Artificial Intelligence and Related Vulnerabilities in the Financial Sector
    Financial Stability Board · 2025-10-10 · 支撑:监测金融业AI采用与相关脆弱性 · 访问日期:2026-08-16