头雁
头雁|2026年09月11日 12:53
对DeepSeek-V4.1-Flash 新版架构影响很大的一篇论文是2024年 的“只需缓存一次:语言模型的解码器-解码器架构”,以及论文的后续论文的更近一步的loop Transformer架构(都在传言的openai的loop Transformer架构),以及后续“只需索引一次:具有共享路由的跨层稀疏注意力机制”。 简单介绍: 普通 Transformer 每层:自己算全文注意力 + 自己存一份 KV ↓ 2024 YOCO https://arxiv.org/abs/2405.05254 切成 Self / Cross 全文 KV 只写一次,Cross 反复读 → 显存和 prefill 下来,仍能看全文 ↓ 2026-04 YOCO-U https://arxiv.org/abs/2604.01220 Self 循环加深,KV 仍一份 → 有效深度上去,全局 cache 不跟深度走 ↓ 2026-06 YOIO https://arxiv.org/abs/2606.06467 Cross 也不再每层扫完全部 KV top-k 下标只算一次,各层共用 → 长生成时「查笔记」也稀疏化(头雁)
+6
曾提及
分享至:

脈絡

熱門快訊

APP下載

X

Telegram

Facebook

Reddit

複製鏈接

熱門閱讀