TECHUB NEWS 香港报道|记者 Alma Li|2026年9月
导语:
当大模型让策略生成、信息处理与历史回测变得越来越快,一份看似漂亮的结果,究竟有多少来自真正独立、足够且可信的证据?HighBlock Limited 产品经理、独立开发者伯纳德 zkBernard 正在开发「投研证据折扣器(Evidence Deflator)」,试图把 AI 投研里常被忽略的验证问题前置:在策略得出结论之前,先审计模型知识覆盖、回测区间、参数搜索与统计门槛,判断这份回测到底有没有足够的分辨力。
在 AI 投研精英孵化计划的交流中,伯纳德 zkBernard 提出了一个很直观的比喻:让大模型用其训练数据已经覆盖的历史区间来验证策略,就像让考生做一张已经看过答案的试卷。
核心观点:
“分数可能很高,但它检验到的未必是能力,也可能只是记忆。”他说。
选择从“验证层”切入 AI 投研的原因:市场上不缺用 AI 生成观点、筛选标的、搭建策略的工具;真正稀缺的是另一种能力:当一个模型给出一份漂亮回测,研究者如何分辨其中哪些是独立证据,哪些只是模型或研究者对已知历史的重复利用?
伯纳德目前在 HighBlock Limited 从事香港合规框架下的加密资产机构业务产品设计与行业研究,覆盖理财与 RWA、做市、托管、OTC、AI 等方向;工作之外,他也进行独立开发和开源研究,关注 AI 判断的独立性,以及 Agent 工具之间的协议互操作。两条路径最终交汇在同一个问题上:AI 可以更快地产生结论,但结论是否经得起验证,不能被默认成立。
一份回测,可能是一场“开卷考试”
TECHUB NEWS:很多人会把“回测周期够长、收益曲线够漂亮”视为策略有效的信号。你为什么认为这还不够?
伯纳德 zkBernard:传统直觉会认为,回测时间越长越好:如果一套策略在过去三年、五年、十年都有效,未来或许也会继续有效。
但当策略设计、解释或验证本身依赖大模型时,问题会变得不一样。模型有知识截止日,也在训练阶段接触过大量公开市场信息、历史事件和既有叙事。如果我们拿模型知识截止日之前的历史数据去验证它给出的判断,就很可能是在让它处理一份“已经做过的试卷”。
它得出的高分,未必说明这套逻辑真的能迁移到未来;有时,它只是在调用或复述自己已知的市场记忆。
TECHUB NEWS:这种“开卷考试”风险,具体会怎么出现?
伯纳德 zkBernard:至少有三种比较典型的情况。
第一,模型设计了一套策略,回测结果漂亮得可疑。它可能已经知道过去几年某类资产上涨背后的原因,于是顺着已知结果组织出一套看起来合理的逻辑。
第二,研究者换一种问法继续问模型,得到的结论几乎没有变化。我们以为这证明策略很稳健,但它也可能只是同一份记忆被换了种说法复述了两次。
第三种更隐蔽:研究者自己在选择回测区间时,已经不自觉地知道这段历史发生过什么。比如,看到某一轮芯片行情后,再专门挑这一段区间去验证相关策略。此时“开卷考试”的不只是模型,也包括研究者本人。
所以问题不只是“AI 会不会出错”,而是研究流程本身有没有把已知答案带进验证环节。
不是判策略对错,而是先审计证据
TECHUB NEWS:你正在做的「投研证据折扣器」,具体要解决什么问题?
伯纳德 zkBernard:它不是一个直接告诉你“这套策略有效”或“这套策略无效”的工具,更像是在策略结论之前增加一个审计层。
我希望它先检查几个关键问题:模型自身的知识截止日是什么;回测的起止时间在哪里;研究者设定了哪些统计指标和门槛;为了得到最终结果,实际尝试过多少组参数、采用了怎样的参数搜索结构。
这些信息共同决定,一段表面上很长的历史样本,究竟还能算作多少真实、独立的证据。工具所做的,是把“表面证据”折算成“实际证据”,并给研究者一个明确判断和下一步建议。
TECHUB NEWS:也就是说,重点不是回测“好不好看”,而是它是否有足够分辨力?
伯纳德 zkBernard:对。这两者很不一样。
假设一段回测横跨 66 个月,但其中大部分历史已经可能被模型训练数据覆盖,真正未被覆盖、相对独立的样本可能只剩下 8 个月;而按这套策略的风险和统计特征,可能需要约 48 个月才具备足够的统计分辨力。
这时不能简单说“结论不够强”,更准确的说法是:这份回测暂时没有足够分辨力。它没有提供足够独立的样本,让我们判断策略是否真的具备可迁移的有效性。
这个区别很重要。“结论不够强”容易让人继续为原有观点找理由;“证据没有分辨力”则要求研究者回到验证设计本身,承认此刻还不能下结论。
调参越多,所需验证越长
TECHUB NEWS:除了模型知识覆盖,为什么你也特别关注反复调参?
伯纳德 zkBernard:因为探索中不断试参数是很常见的,但如果研究者尝试了很多组参数,最终只展示表现最好的一组,就会产生明显的选择偏差。
例如,一套策略原本可能需要约 48 个月的有效验证期;如果在过程中尝试了 20 组参数,再从中保留表现最好的结果,所需的验证期就可能被显著抬高到约 112 个月。原因并不复杂:被挑中的“最优结果”有一部分可能来自偶然性,而不是策略真正的能力。
这对普通研究者最重要的提醒是:不要只保留最终胜出的参数组合。参数尝试次数、筛选规则和被淘汰的方案,本身也是研究证据的一部分,应该被记录下来。
TECHUB NEWS:如果工具给出的结果是“证据不足”或“回测没有分辨力”,研究者下一步应该做什么?
伯纳德 zkBernard:不是机械地延长回测时间,而是根据问题出在哪里采取行动。
如果独立样本不足,就应保留更严格的样本外测试,或等待、收集更多未被已有知识覆盖的新数据;如果参数搜索过多,就要减少无约束的试错,把参数尝试过程完整记录下来;如果历史数据本身不足以支持判断,也可以考虑换一种验证方式,例如跨市场、跨资产类别或不同市场状态下的测试。
工具的价值不在于代替研究者做判断,而在于让“暂时不能相信”成为一个可解释、可执行的结论,而不是一句模糊的风险提示。
从“怎么用”回到“为什么可信”
TECHUB NEWS:你为什么带着这个项目参加 AI 投研精英孵化计划?
伯纳德 zkBernard:一方面,我希望认识更多做 AI 投研的同行,看看大家如何理解研究、策略和产品;另一方面,我也想验证一个想法:市场上是不是确实需要一个更前置的审计层。
传统基金会请第三方核查业绩,例如围绕投资业绩标准建立可查的记录。但我在想,为什么一定要等业绩出来、甚至出现问题以后,才去做验证?能不能在策略和投研方法形成结论之前,就先把验证过程留下可复核的记录?
我想做的,是把这套审计逻辑向前推一步。
TECHUB NEWS:孵化营过程里,有没有让你重新思考产品的反馈?
伯纳德 zkBernard:有。导师和同行会不断追问:这到底是一套什么机制?为什么这些数字能够帮助识别回测是否有效?
我后来反思,做产品的人很容易把“产品怎么用”当作“产品为什么成立”来解释:我输入什么,系统输出什么,再如何测量。但用户真正想知道的,是为什么这些参数能识别模型回忆、样本覆盖或选择偏差。
这提醒我,产品不仅要有流程,也必须把原理讲清楚。特别是在 AI 投研里,如果一个工具本身不能被理解、不能被复盘,就很难成为真正值得信任的基础设施。
未来:嵌入工作流,而非替代判断
目前,这一工具已在小范围内供同事和朋友试用,主要用于检验个人投资策略的逻辑有效性。伯纳德也保持着审慎态度:即使个人持仓近期表现不错,也未必完全来自策略本身,可能只是赶上了整体市场上涨。
“如果策略只是跟着大盘走,我直接买指数也许就可以。”他说。下一步,他计划将策略与标普 500、QQQ 及更贴近策略所属板块的相关指数进行对比,进一步区分策略可能产生的 Alpha,与市场整体 Beta 所带来的收益。
在产品迭代上,他希望优先加强样本独立性的评估,例如衡量不同参数变体之间的重合程度;同时,也在考虑将工具以 API 或 MCP 等形式接入回测和 Agent 工作流,减少对单独前端界面的依赖。初期目标用户将主要是有风控和策略优化需求的机构,也会兼顾个人研究者。
对于刚开始借助大模型做投资研究、策略生成或回测的人,伯纳德最希望他们先问自己一个问题:
“这份漂亮的结果,究竟有多少来自真正独立、足够且可信的证据?”
当 AI 让“创造”变得更便宜,验证也许会成为更稀缺的能力。「投研证据折扣器」并不提供买卖结论,它试图提供的是一条更审慎的路径:先确认一份结论是否经得起验证,再讨论这套策略是否值得相信。
编辑说明:本文根据 TECHUB NEWS 对伯纳德 zkBernard 的访谈录音、会议纪要及采访提纲整理。受访者所在公司、产品功能、技术方案及后续计划,均以其访谈表述和采访资料为基础;涉及工具示例中的样本期、参数数量及验证期,仅用于说明方法论,不代表实际投资表现或未来结果。
免责声明:本文仅作信息交流与研究方法讨论,不构成任何投资建议。证券、期货合约及虚拟资产价格可升可跌,过往表现不代表未来结果。读者不应仅依赖本文内容作出投资决策,并应根据自身投资目标、财务状况及风险承受能力审慎评估,必要时咨询独立专业意见。
免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。
