头雁|2026年09月11日 12:53
对DeepSeek-V4.1-Flash 新版架构影响很大的一篇论文是2024年 的“只需缓存一次:语言模型的解码器-解码器架构”,以及论文的后续论文的更近一步的loop Transformer架构(都在传言的openai的loop Transformer架构),以及后续“只需索引一次:具有共享路由的跨层稀疏注意力机制”。
简单介绍:
普通 Transformer
每层:自己算全文注意力 + 自己存一份 KV
↓ 2024 YOCO https://arxiv.org/abs/2405.05254
切成 Self / Cross
全文 KV 只写一次,Cross 反复读
→ 显存和 prefill 下来,仍能看全文
↓ 2026-04 YOCO-U https://arxiv.org/abs/2604.01220
Self 循环加深,KV 仍一份
→ 有效深度上去,全局 cache 不跟深度走
↓ 2026-06 YOIO https://arxiv.org/abs/2606.06467
Cross 也不再每层扫完全部 KV
top-k 下标只算一次,各层共用
→ 长生成时「查笔记」也稀疏化(头雁)
分享至:
脉络
热门快讯
APP下载
X
Telegram
复制链接