AI Post Transformers · visual companion
Parallelizing DeltaNet Linear Transformers over Sequence Length
June 2024 paper by Songlin Yang, Bailin Wang, Yu Zhang, Yikang Shen, and Yoon Kim.
Focus: making DeltaNet-style delta-rule linear attention train in parallel over sequence length.
Extracted arXiv IDs: 2406.06484