训练与推理
Tri Dao
FlashAttention · Mamba
Tri Dao 研究机器学习与计算机系统的交叉问题,代表工作包括 FlashAttention 和 Mamba。他在斯坦福大学获得博士学位,曾任普林斯顿大学助理教授,后来以访问研究学者身份继续与该校合作,并担任 Together AI 首席科学家。
2022 年,他与合作者提出 FlashAttention,通过减少 GPU 不同存储层级之间的数据搬运,降低注意力计算的显存开销并提升效率。该方法保留精确注意力的计算目标,重点改变执行方式。
2023 年,他与 Albert Gu 共同发表 Mamba,探索通过选择性状态更新处理长序列的模型结构。前者优化注意力执行,后者改变序列建模方法,共同体现了将算法与硬件效率一起考虑的研究方向。