ビルダー / シニアスタッフ ML サイエンティスト
マルチモダリティ、音声のテキスト空間アライメント、そしてボイスエージェントに関心があります。NVIDIA Research と Amazon ASR-LM に在籍し Andreas Stolcke と協働、また Google(現 DeepMind Audio)の研究インターンとして Tara N. Sainath のチームで Bo Li・Yu Zhang の共同ホストのもとで研究しました。
🎓 博士論文は、プライバシー保護かつロバストな音声モデル適応(現在でいうポストトレーニング)に関するもので、Chin-Hui Lee 教授の指導を受けました。
🧬 ジョージア工科大学の前は、Jesper Tegnér 教授の進化的機械学習グループを訪問し、TSMC で混合信号 IC 設計のインターンを経験しました。
⚛️ 余談: 趣味として量子機械学習にも取り組んでおり、変分回路に基づく初の音声 [ICASSP 21] と言語理解 [ICASSP 22] を生み出し、2019 年に Xanadu AI Quantum ML Award を受賞しました。最近では LLM の量子パラメータ適応 [ICLR 25] に取り組んでいます。
ボイスエージェントと、テスト時スケーリングの楽しみ。
音声モデルのためのポストトレーニング。
フロンティア級のオープンモデルはどう聴くのか。エンコーダフリーの音声パス(d-mel、毎秒20トークン)とインターリーブ推論を、一歩ずつ図解。