ansgar.eth
ansgar.eth|2026年09月15日 23:31
看起来非常令人兴奋!一直以来都觉得最佳的模型架构可能是每个逻辑步骤对应一次前向传播。LLM在一个极端上非常浪费,每个token都需要一次前向传播。这看起来更像是每个提示对应一次前向传播? 如果现在能以某种方式将其串联起来进行多步骤(即多次前向传播)推理,并最终选择性地用小型LLM廉价地解包,这会非常有趣。
分享至:

热门快讯

APP下载

X

Telegram

Facebook

Reddit

复制链接

热门阅读