【译】长上下文推理上,滑窗注意力优于线性注意力 [R]
一篇新 arXiv 预印本称:带 sink 的滑动窗口注意力(SWA)作为缓解 LLM 二次复杂度的简单方案,在长上下文推理基准上表现不亚于甚至远好于各实验室花大量后训练算力做的线性注意力变体。作者报告在 Needle-in-a-Haystack 与 BABILong 上 SWA 性能可达线性注意力的 2–10 倍,并强烈建议优先改用 SWA,而非继续后训练线性模型。
汇聚 V2EX、Hacker News、掘金等 IT 社区的热门讨论与精华内容。
一篇新 arXiv 预印本称:带 sink 的滑动窗口注意力(SWA)作为缓解 LLM 二次复杂度的简单方案,在长上下文推理基准上表现不亚于甚至远好于各实验室花大量后训练算力做的线性注意力变体。作者报告在 Needle-in-a-Haystack 与 BABILong 上 SWA 性能可达线性注意力的 2–10 倍,并强烈建议优先改用 SWA,而非继续后训练线性模型。
每年这个时候关于 PhD 职位的冷邮件会明显增多;在不少国家这是正常招聘流程的一部分。但务必避免:超长邮件、海投无关方向、兴趣只写「ML/LLM/AI」这类空泛表述、把 workshop 论文包装成会议论文、过度依赖 LLM 代写思路、用 LLM 总结对方论文,以及无视导师网站上的申请说明。作者建议找真正匹配的方向、展示具体研究兴趣与独立思考。
原文摘录(经翻译):帖子展示 TinyTPU 项目:一个 SystemVerilog 脉动阵列被编译为 WASM,并在浏览器中运行,验证结果与 NumPy 参考实现一致。