FastAFD: Open-Source Large-Scale Attention-FFN Disaggregation on Blackwell NVL72July 6, 2026Yichao Fu*, Yuxuan Zhang*, Ruitian Wang, Junda Chen, Hao Zhang
JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree DraftingJune 22, 2026Lanxiang Hu, Zhaoxiang Feng, Yulun Wu, Haoran Yuan, Yujie Zhao, Yu-Yang Qian, Bojun Wang, Peng Zhao, Daxin Jiang, Yibo Zhu, Tajana Rosing, Hao Zhang
FastWan-QAD: FastVideo generates a 5-Second Video in 1.8 Seconds on a Single NVIDIA GeForce RTX 5090 via Quantization-Aware DistillationJune 15, 2026FastVideo Team
Open-sourcing FastVideo Dreamverse: Real-Time Vibe Directing with LTX-2 on a single NVIDIA B200 GPUMay 26, 2026FastVideo Team
Attn-QAT: Making 4-Bit Attention Actually WorkApril 8, 2026Peiyuan Zhang*, Matthew Noto*, Wenxuan Tan*, Chengquan Jiang, Will Lin, Wei Zhou, Hao Zhang
From Physical Commonsense to Scientific Reasoning: Why World Modeling in Video MattersFebruary 12, 2026Lanxiang Hu, Abhilash Shankarampeta, Yixin Huang, Zilin Dai, Haoyang Yu, Yujie Zhao, Haoqiang Kang, Daniel Zhao, Tajana Rosing, Hao Zhang
CAD: Disaggregating Core Attention for Efficient Long-context Language Model TrainingDecember 17, 2025Yonghao Zhuang*, Junda Chen*, Bo Pang, Yi Gu, Yibo Zhu, Yimin Jiang, Ion Stoica, Eric Xing, Hao Zhang
Fast and Accurate Causal Parallel Decoding using Jacobi ForcingDecember 16, 2025Lanxiang Hu*, Siqi Kou*, Yichao Fu, Samyam Rajbhandari, Tajana Rosing, Yuxiong He, Zhijie Deng, Hao Zhang