Bastix
Insights

从"一次回答"到"跨交易日持续研究":长程自治 AI 智能体的技术门槛、落地形态与金融风险

长程自治智能体的价值不在"一次能干多久",而在能否跨交易日维护状态、溯源、调度与审计。本文梳理长期记忆、事件溯源、状态演进、可靠调度、错误累积五大技术门槛与金融风险。Bastix 是只做研究、不下单、不连券商、不承诺收益的投研智能体,公开披露长期记忆可能遗漏、部分数据无 PIT、统一审计与外部模型供应商边界尚未完全确认。

执行摘要

过去两年,AI 智能体(agent)的能力边界正在从“把一个复杂问题一次性做完”,转向“在时间中持续存在”:保存状态、等待外部事件、按计划重新唤醒、读取新增数据、修正旧判断,再把新的状态留给下一轮。OpenAI 的 Deep Research 已把单次研究拉长到分钟级的多步骤搜索与综合;2026 年的 SentinelBench 则进一步把研究对象转向“环境会随时间变化、智能体需要等待并在事件发生后反应”的持续监控任务。这两类能力并不等价:前者主要解决“这一次研究得够不够深”,后者解决“明天醒来时,它是否还知道昨天发生了什么、为什么这么判断,以及哪些条件已经改变”。

这也是“long-horizon autonomous AI agents(长程自治智能体)”最有实际意义的分界。本文采用一个操作性定义:长程智能体不是单纯把上下文窗口做大,而是一个可跨会话、跨时间持续维护任务状态,能够按时间或条件重新触发、调用外部数据与工具、记录状态演变,并在中断后恢复的执行单元。 这一概念与早期 Generative Agents 的“记忆—反思—规划”、MemGPT 的分层记忆,以及近年来 long-running monitoring benchmark 的演进一脉相承。

真正的技术难点因而不再只是大模型“推理能力”,而是五个相互耦合的问题:长期记忆、事件溯源、状态演进、可靠调度和错误累积控制。LongMemEval 表明,即使是商业聊天助手和长上下文模型,在持续交互中的记忆任务上也出现约 30% 的准确率下降;τ-bench 则显示,工具型智能体即使单次看来有能力,在重复运行时仍可能缺乏一致性。换言之,延长时间并不会自动带来更强的自治,反而会把“一次回答里的幻觉”变成“能够污染后续数十轮状态的持久错误”。

金融研究是这一范式很自然、也很苛刻的应用场景。价格、公告、财务披露、持仓假设和投资逻辑都随交易日演进;研究员真正需要的并非每天重新问一遍相同问题,而是让系统记住“昨天的假设是什么、今天什么证据支持或推翻了它、当前研究口径的仓位状态是什么、下一次应该在什么时候检查什么条件”。但金融同时放大了数据时点、证据链、误差累积和监管边界,因此它既可能成为长程智能体最有价值的场景之一,也可能是最不能容忍“黑箱自治”的场景之一。W3C 的 provenance 标准把来源、活动、时间和责任主体视为判断数据可信度的重要基础,而中国证券监管实践持续强调投资建议依据、人员资质、适当性、风险提示及营销留痕等问题。

Bastix/大斑 为例,其公开上线能力已经展示出一种较完整的“持续投研单元”形态:官方将相关 TAP 页面定义为绑定沙箱、由节点和规则组成、可持久化和恢复的策略执行单元,并在产品版本说明中明确把长任务按 “研究 → 观察 → 持仓 → 复盘” 推进;同一智能体可以挂多个持续任务计划,如盘前扫描、盘中跟踪和收盘复盘。这里的“持仓”必须严格理解为 沙箱中的策略仓位研究账本:官方明确说明 Bastix 内置能力不连接券商、不接管资金,也不代替用户下真实订单。本文不将其描述为自动交易系统,也不据此作任何收益或投资效果判断。

与此同时,Bastix 的公开资料也给出了值得行业重视的反面信息:其长期记忆页面承认召回可能遗漏、压缩或误关联;数据源页面称数据许可范围、公开延迟和缺失修订机制尚未完成责任人确认;边界文件又明确表示,产品、安全、隐私和法务责任人复核尚未全部完成,外部模型供应商的数据处理边界以及覆盖全部动作的统一审计链也尚未确认。因此,公开能力已经足以证明“持续投研工作流”这一产品形态存在,但不足以证明其长期准确率、完整数据许可、统一审计或生产级可靠性已经得到独立验证。相关独立第三方 benchmark 或审计:暂无公开证据。

为什么一次性问答不够

传统生成式 AI 的基本交互单位是“问题—回答”。即使加入联网搜索,其隐含假设仍是:用户此刻提出任务,模型收集此刻可获得的信息,最终输出一个静态答案。Deep Research 把这个过程扩展为多步骤搜索、阅读和综合,OpenAI 最初公开的典型运行时间为约 5—30 分钟;这已经显著区别于普通即时问答,但本质上仍属于“启动一次任务—完成一次报告”的范式。

持续研究的核心问题却发生在报告完成之后。 一家公司第二天可能发布公告,一项政策三周后可能落地,一个此前尚未满足的价格或基本面条件可能在未来某个交易日发生。此时最优策略往往不是让智能体不断刷新网页,而是让它“睡眠”,等到指定时点或事件后重新启动。2026 年发布的 SentinelBench 正是针对这一问题:其任务环境随时间推进,智能体需要监视环境、发现能够继续任务的新事件,并在响应速度与资源消耗之间权衡;论文明确指出,对许多长期任务而言,不停执行工具调用并不是合适策略。

这使得“长程”与“长上下文”成为两个不同概念。一个百万 token 的上下文窗口可以让模型看见更多过去,但不能自动解决“什么时候醒来”“哪个事实已经失效”“昨天的假设现在是什么版本”“某条信息是否属于当时已知信息”等时间问题。LongMemEval 将长期记忆拆成信息提取、多会话推理、时间推理、知识更新和拒答五种能力,并发现简单扩大上下文并没有消除长期交互中的显著性能损失。

对投研而言,差别尤其明显。一个静态回答可能是:

“根据当前财报、估值和行业新闻,形成一份公司研究。”

而持续研究真正需要维护的是一个状态机

“昨日研究假设为 A;等待事件 B;今日公告 C 到来后,重新检查 A;保留支持证据与反证;更新观察状态;同步研究口径的策略仓位;收盘后复盘判断偏差;下一交易日继续。”

Bastix v1.0.5 公开说明的设计恰好体现了这一变化:系统把投资研究视为跨时段长任务,沿“研究—观察—持仓—复盘”推进,在进入下一阶段前先判断当前阶段和时间轴;必须等待未来条件的工作会留待之后触发,而不是为了完成当前对话而强行得出结论。

这也是为什么 METR 的“task-completion time horizon”指标需要谨慎解读。METR 当前用一百余项软件工程、机器学习和网络安全任务估计:在人类专家需要某一时长完成的任务上,AI 能以多大概率成功。METR 自己特别强调,这个指标衡量的是任务难度对应的人类完成时长,并不意味着 AI 可以在现实环境中无人值守运行相同时长;其测试任务也比真实工作的开放环境更加自包含、目标明确。换句话说,“模型能够完成相当于人类数小时工作的任务”不能直接外推为“它能够可靠管理数天或数周的金融研究流程”。

Anthropic 与 Andon Labs 的 Project Vend 提供了一个有价值的现实参照。实验让 Claude 约一个月持续管理一个办公室小商店,系统专门提供笔记与持久信息工具,因为完整运行历史会超过上下文窗口;最终 Anthropic 的判断是,该智能体当时仍犯了太多错误,不能胜任独立经营。这并非金融实验,但它说明了一个普遍规律:当智能体从“给建议”升级到“长期维护一个不断变化的现实状态”时,单次看似聪明的行为不等于长期经营可靠性。

因此,长程智能体真正增加的并不是“多思考几十分钟”,而是三个新的时间维度:

过去必须能够被准确恢复;现在必须知道当前事实与状态;未来必须知道何时、在什么条件下重新执行。缺一项,它仍然只是一个更复杂的一次性聊天机器人。

长程智能体的技术门槛:从“会推理”到“持续正确”

长期记忆首先是一个信息工程问题,而不是单纯的 token 问题。 Generative Agents 的经典设计是保存经验记录、生成更高层反思,再动态召回用于规划;MemGPT 则模仿操作系统的分层内存,在不同记忆层之间移动信息,以突破固定上下文窗口。LongMemEval 后来进一步把实际记忆系统概括为 indexing、retrieval、reading 三个阶段。这三类工作共同说明,生产级长期记忆的核心是“什么值得存、以什么结构存、什么时候取、取错后如何识别”,而非把所有历史机械塞回提示词。

对于财经场景,尤其需要把至少三类东西分开:原始证据、派生判断、当前状态。例如“公司 8 月 10 日发布公告”属于证据;“该事件削弱需求假设”属于模型判断;“研究口径目标仓位由 X 变为 Y”属于状态。若三者都被压缩成一句自然语言长期记忆,下一轮模型很容易把过去的判断重新读取为事实。这正是为什么 provenance 不能被视为附加功能:W3C PROV 将实体、活动、生成/使用关系、责任主体和时间作为来源模型的核心结构,目的之一就是支持对数据质量、可靠性和可信度的判断。

事件溯源的第二层要求是 point-in-time(PIT,时点)一致性。 金融数据今天看到的“历史数字”未必是当时能够看到的数字;若智能体在复盘 2025 年的决策时不区分披露日和报告期,或者使用后来修订的数据,就会产生前视偏差。Bastix 当前数据文档专门登记“报告期”和“数据可见日”,并称营业收入、归母净利润和每股收益提供 PIT 口径;但同一文档同时注明 ROE、销售毛利率目前使用最终修正版,因为数据源暂无时点版本。这一细节非常重要:拥有 PIT 字段不等于所有指标都具备完整 PIT 历史。

状态演进比“记住事实”更困难。 长期运行的研究单元必须允许事实、假设、阶段和策略仓位分别演进,而不是用新文本直接覆盖旧文本。否则系统很难回答三个关键问题:“什么时候改变了看法”“是什么证据导致改变”“改变之前系统掌握什么”。LongMemEval 把 knowledge update 与 temporal reasoning 单独列为记忆能力,本质上就是承认“记得旧信息”与“知道它后来已经改变”不是同一能力。

调度也不是简单加一个 cron。 一个真正的无人值守研究任务至少可能面对定时触发、交易日历、条件门禁、服务重启恢复、重复执行防护、失败重试和超时控制。SentinelBench 把 reaction time 和 resource use 与任务完成度共同纳入评价,因为高频轮询虽然可能响应更快,却也会提高调用成本;金融场景还存在休市、临时停牌和披露时点等额外状态。

Bastix 的公开实现已经能看到这一工程层:持续任务支持条件门禁;服务重启后可恢复仍然生效的计划;运行时加入活性和占用约束以减少卡死和重复执行;同一智能体可以维护多个独立计划,例如盘前、盘中、收盘后分别运行。其行情采集也公开描述了幂等、重试和完整性记录,并与交易日历和 K 线收盘节奏结合。

然而,这类工程设计只是必要条件,不是充分条件。错误会随时间形成路径依赖。 一个一次性回答错了,用户可以丢弃它;一个持续智能体若把错误结果写入长期记忆、策略状态或下一轮任务条件,后续推理可能在错误前提上继续正确地推导,从而形成“逻辑自洽、事实已经偏离”的轨迹。τ-bench 引入 pass^k,正是因为智能体是否能够在多次运行中保持一致性,与单次成功率并不是一回事;其原始实验中,测试的先进 function-calling agent 在任务上的总体成功率仍低于 50%,零售域的 pass^8 低于 25%。该结果不能直接外推到金融智能体,但足以说明“重复可靠性”应被单独测量。

一个简单的数学示意可以帮助理解累积效应:如果理想化地假设一条 100 步链条中每一步独立正确率都是 99%,则全部 100 步均正确的概率只有约 0.99^100 ≈ 36.6%。现实中的智能体错误并不独立,而且可以通过校验、恢复和纠错降低这种效应,所以这不是任何实际产品的故障率预测;它只是说明,长程系统的目标函数不能停留在“每一步大体正确”。

2026 年更多长程 benchmark 正在验证这一点。HORIZON 专门通过延长任务结构和失败归因分析智能体随 horizon 增加后的退化;最新的 long-horizon 研究也指出,连续任务会引入历史污染、先前行动遗留状态以及错误输出对后续决策的影响。与此同时,SentinelBench 把“等待正确事件”纳入长程能力测试,显示研究界已经从“连续做更多步骤”转向评估“在变化环境中持续维护正确状态”。

下表把主要记忆与持续运行方案放在同一技术框架中。它不是产品排名,而是说明:记忆、调度、数据和审计必须一起设计。

架构/方案长期记忆方式状态演进与调度典型数据来源可视化 / 审计能力核心短板
全上下文 / 历史重放把历史会话重新放入模型上下文本身不解决定时唤醒,需要外部 scheduler会话历史、当前工具结果通常只能看聊天历史成本随历史增长;旧信息、噪声和冲突一起进入上下文;LongMemEval 显示长上下文本身不足以解决持续记忆问题。
向量 RAG 长期记忆历史切块、embedding、语义召回可配外部定时/事件触发私有文档、历史记录、知识库可记录召回 chunk,但未必保留完整因果链召回遗漏、错误关联、旧记忆未失效是主要风险;Bastix 自身也公开承认这类限制。
情景记忆 + 反思保存事件,再周期性生成高层总结或反思反思可在事件数、时间或任务阶段触发经历日志、环境观察可追溯原始事件时较强,否则反思可能成为新的不可验证事实摘要压缩有损;错误反思可反向污染未来计划。Generative Agents 属于这一代表性设计。
分层 / 虚拟记忆工作记忆与外部长期存储分层,按需要换入换出scheduler 与 memory manager 可分离对话、文档、工具状态取决于具体实现memory paging 解决容量,不自动解决来源真实性或状态版本控制。MemGPT 是代表方案。
事件日志 / provenance-first原始事件尽量追加而非覆盖;判断与状态建立派生关系时间和事件均可作为触发依据带时间戳的原始数据、工具调用、状态变更理论上最适合“为何变化”的回放存储、索引和查询复杂度更高;需要建立实体—活动—时间—责任链。W3C PROV 提供通用模型。
Bastix TAP 当前公开形态沙箱中的会话/任务上下文 + 私有知识库 + 独立策略仓位账本按设定时间持续触发,可多计划并行、条件门禁、重启恢复;官方示例包括盘前/盘中/收盘节奏A 股、ETF、指数的 K 线、公告、财务、龙虎榜、交易日历、成分等,另有版本更新披露两融与北向资金TAP 状态/控制历史、任务运行记录、策略仓位变更记录、节点提示词、回复来源核查等;但官方未承诺覆盖全部动作的统一审计链召回可能遗漏或误关联;数据许可与延迟责任核验未完成;底层统一审计与部分外部模型治理边界尚未确认。

落地形态:从深度研究到 Bastix TAP

当前市场上的“长程”产品实际上可以分为三个层次。

第一层是长耗时单任务:例如一次复杂搜索运行几分钟到几十分钟,最后生成报告。OpenAI Deep Research 是典型形态。它解决的是搜索深度、工具使用与来源综合,不应与数天乃至数周的持续状态维护混为一谈。

第二层是持续监控型 agent:任务不是立即完成,而是等待邮件、网页状态、市场信息或其他外部事件变化后继续。SentinelBench 在包含金融等场景的 10 类合成 Web 环境、100 个任务中专门评价这种能力,并同时测量任务完成、反应时间与资源使用。这种范式更接近企业中的“监控—触发—处理”工作流。

第三层则是持久研究状态机:除了等待事件,还把历史判断、当前阶段、任务状态和领域数据写入持久化对象,以便在下一次运行时恢复。Bastix 的 TAP 是目前公开资料中较明确的中国投研垂类案例之一,但其证据目前主要来自产品自己的在线文档,因此以下内容只描述公开、已上线并由官方文档明确登记的能力,不把产品方陈述等同于独立第三方验证。

TAP 的对象模型。 Bastix 官方 /docs/concepts/tap 页面把“策略”定义为绑定沙箱的“可持续运行执行单元”,由节点、规则和画像组成;节点包括研究、风控和一个官方命名为“执行”的节点,规则包括触发条件和边界。这里的“执行节点”是 Bastix 工作流中的节点名称,不能理解为真实证券交易执行,因为同一官方文档体系明确规定系统不连接券商、不接管资金、不代用户下真实订单。策略通过内部系统工具 tap_manager 查询、设置和控制,状态变化与控制命令留有历史,并以中断后从最近进度恢复为设计目标。

TAP 的阶段模型。 v1.0.5 把长期投研明确描述为“研究 → 观察 → 持仓 → 复盘”。系统先判断任务处于哪个阶段及其时间跨度,当未来条件尚未满足时不强制在当前对话得出结论,而是留待以后触发;相关投资事件跨轮次、跨计划持续记录。结合其交易日历与盘前/盘中/收盘任务示例,可以合理地将其理解为一种按交易日节奏推进的持续投研流程,但“每个 TAP 必须每日执行一次”或固定最小周期等参数,官方没有给出统一说明,暂无公开证据

其公开工作流可以概括为:

flowchart LR
    A[研究目标 / 投资假设] --> B[研究阶段<br/>行情・公告・财务・知识库]
    B --> C{时间或条件是否满足}
    C -->|未满足| D[保存上下文<br/>等待下一触发点]
    D --> C
    C -->|满足| E[观察阶段<br/>读取新增事件并核验旧假设]
    E --> F[持仓阶段<br/>更新沙箱策略仓位研究状态]
    F --> G[复盘阶段<br/>记录依据・偏差・反证]
    G --> H[保存任务状态与运行记录]
    H --> I[下一交易日 / 下一事件]
    I --> C

图中“持仓”指研究系统内部的策略仓位状态,而非券商账户持仓;整个流程图不包含证券真实下单或成交。 Bastix 的长期任务文档明确表示,策略仓位管理是独立沙箱账本,记录目标仓位、当前仓位和变化历史,但不是券商账户,不包含可证明的真实下单、成交或滑点信息。

调度接口方面,公开资料显示的核心不是对外 REST API,而是内部 tap_manager 系统工具以及工作台控制。 会员版本公开支持“按设定时间无人值守地持续触发”,免费版本可创建任务、手动触发和查看结果;同一 agent 可以并行维护多个计划。v1.0.4 又披露条件门禁、服务重启恢复、任务活性控制和避免重复执行等机制。至于公开 REST endpoint、SDK、cron 表达式、最小调度间隔、调度 SLA、超时上限等工程参数,暂无公开证据

数据层是 Bastix 案例中最值得金融研究者仔细拆看的部分。 当前数据文档登记 A 股、ETF 和指数,涵盖 1 分钟/60 分钟/日线 K 线、最新行情快照、标的信息、公告、财务、龙虎榜、交易日历以及 ETF/指数成分;v1.0.4 版本说明另披露了融资融券和北向资金能力。数据采集按品类定时执行,并使用幂等、重试和完整性记录。

但“有数据”与“数据可以无条件用于机构级持续研究”并不是一回事。官方数据页明确说明:数据许可范围、公开延迟和缺失修订机制尚未完成责任人确认,更新时间受到数据源、交易时段与可用性影响;当前登记范围也不代表所有标的、所有历史时期或实时性的完整承诺。因此,上游数据供应商完整名单、各品类商业授权范围和延迟 SLA,按公开资料看均不能作进一步确认。暂无公开证据。

数据时点控制也存在“已做一部分,但不是全覆盖”的情况。行情快照带 fresh / stale / unknown 状态;查询可以携带 asOf 和一致性信息;部分财务字段采用数据可见日/PIT 口径。然而 ROE 和销售毛利率等指标目前仍按最终修正版提供。对量化回溯或历史决策复盘而言,这意味着研究者不能仅因为平台出现“PIT”标签就默认整个财务数据仓都无前视偏差。

可视化和审计层面,Bastix 已公开几项有价值的能力。 TAP 的状态变更和控制命令可回看;持续任务的完整运行结果保存在任务运行会话;策略详情可查看智能体各节点系统提示词;策略仓位变更历史以追加方式保存;界面也公开提供策略仓位变更流水,包含时间、标的、目标仓位和理由。这里再次强调,这些是研究账本和策略状态记录,并不代表真实证券交易流水。

此外,其“可信度治理”允许用户针对单条智能体回复主动发起检查,让另一个模型过程对照该轮实际调用到的行情、财务或搜索工具结果,把论断标记为“可溯源”或“存疑”。这比完全没有 evidence check 更进一步,但官方也明确提示:检查由模型辅助完成,只覆盖该轮可用的数据源,并不等同于最终事实认定。也就是说,它是一层事后可核查机制,不是形式化证明系统。

真正需要机构用户注意的是审计边界。Bastix 官方称系统分别保存会话、工具调用、策略仓位变更和任务运行记录,但同时明确表示尚未承诺覆盖所有动作的统一审计链;外部模型供应商的完整训练、日志、评估和人工质检边界也尚未确认。对于个人研究产品,这可能仍处于产品迭代阶段;对于受监管机构环境,则意味着现阶段不能仅凭“有历史记录”就等同于“满足统一审计、模型治理和数据治理要求”。

因此,从公开证据看,Bastix TAP 最准确的定位不是“自动交易机器人”,而是一个带持久状态、调度、市场数据和研究账本的投研智能体执行单元:研究一个假设,持续观察条件,在沙箱中维护研究口径的持仓状态,再进行复盘,并在后续交易日继续。它已经把“agent + scheduler + memory + market data + state ledger + audit UI”组合成产品,但对于独立长期准确率测试、完整模型供应链、数据授权责任、调度 SLA 和统一审计链,目前不能超出官方披露进行推断。

风险:时间越长,治理成本越高

长程智能体最容易被低估的一点,是它改变了 AI 风险的时间结构。一次性模型主要承担“output risk”;持续智能体还承担“state risk”——错误不仅被输出,还可能被保存、重新读取并成为下一阶段行动的前提。LongMemEval 已证明持续交互中的记忆与更新仍是明显薄弱环节;而长程 benchmark 正越来越多地发现,在复杂任务里“保持进展、验证中间状态并可靠收尾”本身就是与单步智能不同的能力。

漂移风险首先来自记忆压缩。假设某智能体将十篇原始报告压成一句“需求仍然强劲”,几周后又把这句话作为“事实”读取,而原始报告中的条件限制已经丢失,系统就完成了从证据到判断、再从判断回到“伪证据”的循环。Bastix 对自己的长期记忆也明确写明,检索可能遗漏、压缩或误关联,且记忆召回片段不等同于经过审核的事实。

累积错误风险更难通过单轮 benchmark 发现。τ-bench 因此使用 pass^k 衡量跨多次运行的一致性;2026 年的长程评估研究也越来越关注 agent 继承自己过去输出、代码或状态之后的退化。对投研系统而言,应该测试的不是“随机抽一日问它公司基本面是否答对”,而是“连续 60 个交易日运行后,它能否解释第 37 日的状态为何变化,并正确处理第 42 日对旧假设的反证”。

数据依赖风险在金融中可能比模型本身更重要。迟到的行情、修订后的基本面数据、错误的交易日边界、供应商字段变化,都可能被大模型包装成非常连贯的分析。Bastix 当前公开的 freshness 标志、PIT 字段、幂等和完整性检查属于正确方向,但其文档同时承认数据许可、延迟和缺失修订机制尚未完成责任确认,且部分财务指标并非 PIT。

外部内容还会带来 agent 特有的安全风险。 AgentDojo 的研究显示,当工具返回的是不可信数据时,网页、邮件等外部内容中的 prompt injection 可以试图劫持智能体执行与用户原目标不同的动作。对于持续研究 agent,这个问题更加棘手,因为恶意或错误内容可能不仅影响当前回答,还可能被写入记忆并在未来重新激活。AgentDojo 包含 97 项现实任务和 629 个安全测试案例,结论是工具型智能体在没有攻击时本身就可能失败,而现有防御也并未彻底解决注入问题。

无人值守并不意味着无治理。 在基础生成式 AI 层面,中国《生成式人工智能服务管理暂行办法》要求面向境内公众提供生成式内容的服务在适用范围内提升准确性和可靠性、保护输入和使用记录等;具体金融产品及功能是否、如何适用,还要依据实际服务模式进行法律判断,不能仅凭“智能体”名称直接下结论。

证券领域的监管边界更加敏感。2026 年 1 月上海证监局对一家证券投资咨询机构采取监管措施,其中包括无登记人员向客户提供投资建议、投资建议提交和审核环节管理不足、误导宣传等问题;既有监管案例也持续强调投资建议依据、风险提示及禁止不当收益宣传。其含义并不是“AI 投研工具天然违法”,而是:一旦产品从研究工具跨越到面向客户的受监管证券投资咨询行为,业务资质、人员、留痕、依据、风险提示和营销边界就可能成为核心合规问题。是否构成相关业务必须结合实际产品模式作专业法律判断。

这也是为什么 Bastix 的公开边界值得特别保留:其官方表述是只在研究与决策层工作,不连接券商、不接管资金、不代用户下真实订单,同时不承诺收益。本文据此仅讨论其作为投研持续研究单元的能力,不将其描述为真实交易执行系统。

下面的风险矩阵为本文基于公开研究与产品资料作出的定性判断,其中“高/中”不是经过统计测算的事故概率。

风险发生机制可能性影响可监测信号更合理的治理方式
记忆漂移 / 陈旧判断复用摘要替代原证据;旧事实没有失效标志;错误召回同一问题跨日理由变化却没有新证据;引用无法定位原文原始证据与派生判断分层;版本化记忆;强制 source/time 标记;周期性重建而非无限累积。
错误累积上一轮错误写入状态,后续推理在错误状态上继续state divergence、反复自我引用、长期任务后半段性能下降用 pass^k/多交易日回放测试;设置 checkpoint;允许回滚;高影响状态变更二次核验。
数据时间穿越 / 修订污染用事后修订值分析历史决策;发布时间与报告期混淆中—高历史复盘表现异常优异;字段缺少 as-of/available-at强制 PIT 数据模型;所有输入记录 available_at;对无 PIT 字段标注限制。Bastix 当前部分字段已有 PIT、部分没有。
数据延迟与供应链依赖上游 API 延迟、缺失、字段变更或授权变化中—高freshness/stale、连续缺口、数据源间冲突多源交叉验证、完整性检测、明确 SLA 与授权责任、降级模式。
外部 prompt injection新闻、网页、附件等不可信内容向 agent 注入指令外部文本要求修改系统规则、访问无关工具或泄露信息数据/指令通道隔离;工具最小权限;高风险调用 policy gate;把外部内容视为不可信数据。
调度卡死 / 重复运行服务重启、超时、并行竞争、重复触发中—高同任务多次运行、心跳缺失、状态长时间未更新lease/idempotency key、重试上限、死信队列、重启恢复和重复运行检测;Bastix 已披露其中部分机制。
审计不完整有聊天记录但无法重建“输入—工具—模型—状态”的完整因果链中—高无法解释某日状态为何改变;无法重现旧结果append-only event log、模型/提示词/工具版本快照、provenance graph;W3C PROV 可作为参考模型。
合规边界漂移产品从研究辅助逐渐增加面向客户的高影响决策功能对外措辞从研究转向具体证券投资行为;依据/人员/留痕机制不足产品能力与营销话术同步合规审查;高影响功能上线前进行法律定性;严格区分研究状态与真实交易。
隐私与第三方模型治理长期记忆、知识库内容进入外部模型服务不清楚哪些片段被发送、供应商日志或保留政策不透明数据分类、供应商契约、最小化传输、可删除性和审计。Bastix 当前亦明确部分供应商边界仍待确认。

一个值得强调的治理原则是:随着 horizon 增长,自治权限不应机械同步增长。 持续运行非常适合“读数据、更新研究状态、发现异常、形成待复核结论”,但越接近不可逆、高经济影响的外部动作,越需要明确的权限边界和人工 gate。NIST 的生成式 AI 风险管理 Profile 也将风险管理放在 AI 产品设计、开发、使用与评估的完整生命周期中,而不是只在模型发布前做一次测试。

结论与建议

长程自治智能体真正值得关注的产业变化,不是“大模型一次能干多久”,而是软件系统是否开始围绕模型建立长期状态、时钟、事件和审计基础设施。当 agent 能够在一次会话结束后继续保存任务、在第二天被重新唤醒并理解昨天的进度时,它才开始从“智能界面”变成“持续运行的软件单元”。SentinelBench、METR、LongMemEval、τ-bench 等研究从不同角度说明,这一方向正在快速发展,但现有系统的持续记忆、一致性和长期可靠性仍远未达到可以由单次 demo 推断生产可靠性的程度。

对财经和科技行业观察者而言,一个有用的判断标准是:不要再用“模型有多聪明”作为评估 long-horizon agent 的主要问题,而应问“它在第 N 天还能否证明自己为什么这么认为”。 一个真正成熟的持续研究系统,应当能够从任何重要结论反向定位到原始数据、数据可用时间、当时所用模型和工具版本、前一状态、触发条件以及状态变化理由。没有这条链,长期记忆越丰富,潜在的错误债务反而可能越大。W3C provenance 模型提供了一个与具体 AI 架构无关的基础思路。

对于机构部署,本文建议把采购或内部验收指标从“单题正确率”改成trajectory-level reliability(轨迹级可靠性):至少用真实历史数据回放几十个交易日,检查状态恢复、事件漏检、重复触发、错误记忆修正、数据修订、断点重启和跨日证据链;同时给出多次重复运行的一致性,而不是只展示一次最佳案例。τ-bench 的 pass^k 和新一代 long-horizon benchmark 都支持这种从单次成功率转向轨迹可靠性的评价思路。

在数据架构上,应把原始事实、模型判断和策略状态做硬隔离。原始事实原则上追加保存并带来源和 available_at;模型判断可以被推翻但不能静默覆盖历史;当前研究状态应由事件投影得到,而不是让大模型自由改写一段“长期记忆总结”。这不是要求所有系统实现完整的 W3C PROV,而是要求最终能够回答 provenance 所强调的基本问题:什么数据经过什么活动、在什么时间、由哪个主体生成了现在看到的结果。

在调度架构上,“无人值守”应理解为无人值守地等待、采集、研究、记录和提醒,而不是“无限授权地持续采取高影响动作”。交易日历、条件触发、幂等、重试、恢复、并发锁和任务预算应当成为 scheduler 的基础能力;长时间没有新信息时,智能体应该可以不做任何事情。SentinelBench 对“持续注意而非持续操作”的强调尤其适合金融场景,因为市场研究天然存在大量等待事件窗口。

Bastix/大斑 的评价,则应同时看到两面。正面来看,公开上线资料已经勾勒出比较完整的投研长程架构:TAP 是可持久化、可恢复的执行单元;任务按照 研究 → 观察 → 持仓 → 复盘 的阶段推进;可以跨计划保留上下文、按时间或条件无人值守触发;拥有 A 股、ETF、指数等市场数据接口、沙箱策略仓位账本以及一定程度的运行记录和来源核查。对于“如何把聊天型 AI 变成跨交易日持续研究工具”这一产品问题,它是一个值得观察的中国案例。

但负面清单同样明确:长期记忆不能保证完整召回;部分数据没有 PIT;数据许可与延迟责任确认尚未完成;部分产品、安全、隐私和法务复核仍未完成;外部模型供应商的数据治理边界没有完全确认;系统尚未承诺覆盖全部动作的统一审计链。 对其长期研究准确率、跨月稳定性、调度 SLA、独立安全审计、独立性能 benchmark、完整数据供应商授权清单等,目前暂无公开证据。因此,行业不应从“已具备长程工作流”直接跳到“已证明机构级长期可靠”。

更广义地看,长程 agent 很可能把 AI 产品竞争的重心从“谁的模型回答最好”,推向“谁能管理时间中的状态”。模型仍然重要,但金融研究真正形成壁垒的部分可能越来越落在模型之外:带时点语义的数据层、可恢复 scheduler、可编辑但可追踪的长期记忆、事件溯源、权限系统、错误回滚以及合规审计。这些部件不像聊天 demo 那样显眼,却决定一个 agent 是能运行三十分钟,还是能在三十个交易日之后仍值得信任。现阶段最稳健的行业判断不是“无人研究员已经到来”,而是:持续研究单元正在从概念进入产品,但长期可靠性仍是需要被证明、而不是被假设的能力。

延伸阅读

  • 长程投资任务:本文所说的长程 agent 在 Bastix 的落地——TAP 作为可持久化、可恢复的执行单元,按研究→观察→持仓→复盘四阶段跨交易日推进。

参考来源

  1. Autonomous agents and profitability dominate AI agenda in 2025, executives forecast
    Reuters · 2024-12-12 · 支撑:自治智能体成2025 AI主线 · 访问日期:2026-08-16
  2. Introducing deep research
    OpenAI · 2025-02-02 · 支撑:Deep Research多步研究5-30分钟 · 访问日期:2026-08-16
  3. Project Vend: Can Claude run a small shop? (And why does that matter?)
    Anthropic · 2025-06-27 · 支撑:Claude经营小店月余仍不胜任 · 访问日期:2026-08-16
  4. 策略(可持续运行的执行单元) / TAP
    Bastix / 大斑 · 支撑:TAP绑定沙箱可持久恢复执行单元 · 访问日期:2026-08-16
  5. v1.0.5 · 智能体分阶段规划
    Bastix / 大斑 · 支撑:长任务研究观察持仓复盘四阶段 · 访问日期:2026-08-16
  6. v1.0.6 · 自动化任务定时调度与策略过程透明化
    Bastix / 大斑 · 支撑:定时调度与策略过程透明化 · 访问日期:2026-08-16
  7. v1.0.4 · 数据源扩展、持续任务接管与稳定性加固
    Bastix / 大斑 · 支撑:条件门禁重启恢复防重复执行 · 访问日期:2026-08-16
  8. 数据源
    Bastix / 大斑 · 支撑:部分字段PIT、许可与延迟待确认 · 访问日期:2026-08-16
  9. 长程任务维护
    Bastix / 大斑 · 支撑:承认召回可能遗漏压缩误关联 · 访问日期:2026-08-16
  10. 可信度治理
    Bastix / 大斑 · 支撑:事后核查只覆盖本轮不等于事实 · 访问日期:2026-08-16
  11. 边界与原则
    Bastix / 大斑 · 支撑:不连券商不接管资金不下单 · 访问日期:2026-08-16
  12. Task-Completion Time Horizons of Frontier AI Models
    METR · 2026-05-08 · 支撑:时长指标不等于无人值守运行 · 访问日期:2026-08-16
  13. LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory
    arXiv(ICLR 2025,Di Wu et al.) · 支撑:长期记忆约30%准确率下降 · 访问日期:2026-08-16
  14. Generative Agents: Interactive Simulacra of Human Behavior
    arXiv(Joon Sung Park et al.) · 支撑:记忆-反思-规划经典设计 · 访问日期:2026-08-16
  15. MemGPT: Towards LLMs as Operating Systems
    arXiv(Charles Packer et al.) · 支撑:分层虚拟记忆突破上下文窗口 · 访问日期:2026-08-16
  16. SentinelBench: A Benchmark for Long-Running Monitoring Agents
    arXiv(M. K. Maldaner et al.) · 支撑:持续监控等待事件的长程基准 · 访问日期:2026-08-16
  17. τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains
    arXiv(Shunyu Yao et al.) · 支撑:pass^k衡量跨次一致性 · 访问日期:2026-08-16
  18. Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance
    arXiv(C. Peng et al.) · 支撑:长程评测超越短任务的增量 · 访问日期:2026-08-16
  19. The Long-Horizon Task Mirage? Diagnosing Where and Why Agents Fail as Task Horizons Increase / HORIZON
    arXiv · 支撑:随horizon增长的退化归因 · 访问日期:2026-08-16
  20. AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents
    arXiv(Edoardo Debenedetti et al.) · 支撑:工具智能体prompt injection风险 · 访问日期:2026-08-16
  21. PROV-DM: The PROV Data Model
    W3C · 支撑:来源模型:实体活动时间责任 · 访问日期:2026-08-16
  22. Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile
    NIST · 2024-07-01 · 支撑:生成式AI全生命周期风险治理 · 访问日期:2026-08-16
  23. 生成式人工智能服务管理暂行办法
    国家互联网信息办公室 · 2023-07-13 · 支撑:境内生成式服务准确性与留痕 · 访问日期:2026-08-16
  24. 关于对上海凯石证券投资咨询有限公司采取责令改正及责令暂停新增客户措施的决定
    中国证监会上海监管局 · 2026-01-19 · 支撑:无资质荐股等被采取监管措施 · 访问日期:2026-08-16