AIPerf: Meta's Performance Modeling and HW/SW Co-design Framework for Data Center–Scale LLM Training
Paul Baumstarck, Joel Coburn, Benjamin Ghaemmaghami, Shobhit Kanaujia, Seah Kim, Hwijoon Lim, Yi-Chien Lin, Mustafa Ozdal, Pyeongsu Park, Kevin Siu, Chunqiang Tang, Pavan Yalamanchili, Jongsoo Park (Meta)
Architecting for Hardware Diversity: Meta's End-to-End Co-Design for High-Performance AI Training on AMD GPUs
Haoyu Zhang (Meta); Arshad Rahman (AMD); Adnan Aziz, Eric Chen, Tianhao Huang, Jeremy Hadidjojo, Ajith Prabhudev, Amin Farmahini, Ben Rhoads, Benson Ma (Meta); Brian Shi (AMD); Cen Zhao, CK Luk, Dingming Wu, Emad El-Haraty, Frank Li (Meta); Haoran Zhang (Meta,NVIDIA); Hiwot Kassa, Jonathan Sheffield (Meta); Jack Taylor (AMD); John Donati (Meta); Julio MachadoSilva (AMD); Karthik Ganesan (Meta); Kent Russell (AMD); KR Kishore, Lei Tian, Liu Ke, Michael Shu (Meta); Muhammad Osama (AMD); Peng Chen, Rakesh Hemnani (Meta); Ryan Swann, Saleel Kudchadker (AMD); Shankar Yanamandram, Shobhit Kanaujia (Meta); Shucai Xiao (AMD); Srinath Bayareddy, Srinivas Vaidyanathan, Sudharssun Subramanian, Supadchaya Puangpontip, Taylor Robie, Tyler Hart, Viswesh Sankaran (Meta); Weijun Jiang, Wenkai Du (AMD); Xiaodong Wang (Meta); Xiaohu Guo (AMD); Yao Rong, Yinbin Ma, Yue Dong, Yuzhen Huang, Yvonne Liu, Hongyi Zeng, Dan Rabinovitsj, Ajit Mathews, Chunqiang Tang (Meta)
MTIA-RT: Enabling a Native PyTorch Experience on Custom AI ASICs
Hangchen Yu, Adam Belay, Jun Luo, Chunqiang Tang, Roman Levenstein, Yige Hu, Anirudh Shaktawat, Alex Mastro, David Reiss, Tim Sham, Jaesoo Lee, Anirban Banerjee, Hyunho Yeo, Youlin Zhang, Jack Montgomery, Kaustubh Gondkar, Ajit Mathews, Wushi Dong, Rumit Desai, Wang Xu (Meta Platforms)
DMA-Latte: Expanding the Reach of DMA Offloads to Latency-bound ML Communication
Suchita Pati, Shaizeen Aga, Mahzabeen Islam (AMD); Ryan Quach (AMD, UC Riverside); Saleel Kudchadker (AMD); Mohamed Ibrahim (Advanced Micro Devices Inc.)
BoostX-RNIC: Fast, Scalable and Flexible AI RNIC
Kanghyun Choi, Bogyeong Park, Gihwan lee (MangoBoost Inc. & Seoul National Univ.); Eunjin Baek, Changsu Kim (MangoBoost Inc.); Hanmin Kim, Nayeon Kim (MangoBoost Inc. & Seoul National Univ.); Changyeon Jo (MangoBoost Inc.); Chanmyeong Kim (MangoBoost Inc. & Seoul National Univ.); Hyeonseong Choi, Dongjoo Lee, Jaehyun Lee, Minho Chu (MangoBoost Inc.); Jangwoo Kim (MangoBoost Inc. & Seoul National Univ.)
Performance Verification of the AmpereOne® CPU Core
Doa'a Al-Otoom, Nicholas Kelly, Aaron Lindsay, Agreen Ahmadi, Ananth Kumar, Anthony Faubert, Ben Chaffin, Bret Toll, Eric Wallace, Lucas Crowthers, Mark Charney, Michael Chin, Michael Spradling, Scott Witscher, Sriyash Caculo, Syed Fakhri, Vivek Kothapalli, William Freelove, Mahesh Madhav (Ampere Computing)
Practical Prefetching of a MAC Scheduler on ARM Neoverse
Jonathan Ling, Paul Cautereels (Nokia Bell Labs); Damien Phan, Henry Wiechert, Krister Wikstrom, Morgan Cormier, Pierre Delbreil, Christope Pavageau (Nokia Mobile Networks); Dragan Samardzija (Nokia Bell Labs)