你好!我是 Lai-YT :smile:

我之前主要在做圖形處理器(GPU)架構和編譯器最佳化,特別關注執行緒束(warp)層級的記憶體存取模式怎麼和圖形處理器的記憶體階層互動,尤其是第一級快取(L1 cache)。這些研究後來成為我的 碩士論文,主題是透過編譯器來根據存取模式選擇合適的記憶體布局。一路做下來,我對傳統的 SIMT 執行模型和圖形處理器效能分析也算相當熟悉。

現在,我把重心轉向大語言模型(LLM)。現今的圖形處理器加入了越來越多專門硬體1和非同步執行機制,它們在大語言模型的運算裡不可或缺。我想進一步了解這些新的執行模型,以及如何利用它們來最佳化大語言模型的運算。我也對相關的軟硬體協同設計有興趣。

興趣

  • 咖啡 :coffee:
  • 書籍 :books:
  • 桌球 :ping_pong:
    • 球拍:Nittaku Acoustic(木吉他),正手:XIOM Vega Pro(Max),反手:Nittaku Fastarc C-1

其他

  • 碩士論文:基於編譯器導引之紋理硬體運用的圖形處理器執行緒束內快取利用率提升技術
  • 簡歷(英文):page_with_curl:

  1. 例如,用來做高吞吐量矩陣運算的張量核心(tensor core),以及負責非同步資料搬移的張量記憶體加速器(TMA)。 

  2. 本論文也收錄於 國立陽明交通大學機構典藏。典藏版本為雙面列印。