AI Post Transformers · Episode Companion

Prompt Boundary-Aware Scheduling with Event Tensors for Dynamic Kernels

arXiv:2604.13327 MLSys 2026 Hongyi Jin, Bohan Hou, et al. · 21 authors CMU · SJTU · NVIDIA · UC Berkeley · Princeton · Tsinghua · Peking Univ. Submitted 2026-04-21

EventTensor treats GPU synchronization events as first-class tensors in the compiler IR, letting a megakernel encode true tile-level data dependencies instead of waiting for whole kernels to finish. This page visualizes the split-K mechanics, the symbolic batch-size template, the data-dependent MoE routing path, the static-vs-dynamic scheduling tradeoff, and the benchmark picture — headline numbers and the caveats around them.

References

  1. Jin, Hou, Wang, Lai, Chen, Ye, Cai, Dong, Cheng, Zhang, Zhao, Huang, Yang, Jiang, Oliaro, Ji, Miao, Grover, Mowry, Jia, Chen — Event Tensor: A Unified Abstraction for Compiling Dynamic Megakernel, 2026. arXiv:2604.13327
  2. Bauer, Treichler, Slaughter, Aiken — Legion: Expressing Locality and Independence with Logical Regions, 2012. scholar link
  3. Augonnet, Thibault, Namyst, Wacrenier — StarPU: A Unified Platform for Task Scheduling on Heterogeneous Multicore Architectures, 2011. scholar link
  4. Yu, Abadi, Barham, Brevdo, Burrows, Davis, Dean, Ghemawat, Harley, Hawkins, Hong, Monga, Murray, Zheng, et al. (Google Brain) — Dynamic Control Flow in Large-Scale Machine Learning, 2018. scholar link
  5. Moritz, Nishihara, Wang, Tumanov, Liaw, Liang, Elibol, Yang, Paul, Jordan, Stoica — Ray: A Distributed Framework for Emerging AI Applications, 2018. scholar link
  6. Cheng, Zhang, Zhou, Ji, Jiang, Zhao, et al. — Mirage Persistent Kernel: A Compiler and Runtime for Mega-Kernelizing Tensor Programs, 2025. scholar link
  7. Spector, Juravsky, Sul, Dugan, Lim, Fu, Arora, R — Look ma, no bubbles! Designing a low-latency megakernel for Llama-1B, 2025. scholar link
  8. Jangda, Maleki, Mehri Dehnavi, Musuvathi, Saarikivi — A Framework for Fine-Grained Synchronization of Dependent GPU Kernels (CuSync), 2024. scholar link
  9. Hagedorn, Fan, Chen, Cecka, Garland, Grover — Graphene: An IR for Optimized Tensor Computations on GPUs, 2023. scholar link
  10. Aimuyo, Oh, Singh — FlashMoE: Fast Distributed MoE in a Single Kernel, 2025. scholar link