Huck Yang

ビルダー / シニアスタッフ ML サイエンティスト

概要

マルチモダリティ、音声のテキスト空間アライメント、そしてボイスエージェントに関心があります。NVIDIA Research と Amazon ASR-LM に在籍し Andreas Stolcke と協働、また Google(現 DeepMind Audio)の研究インターンとして Tara N. Sainath のチームで Bo LiYu Zhang の共同ホストのもとで研究しました。

🎓 博士論文は、プライバシー保護かつロバストな音声モデル適応(現在でいうポストトレーニング)に関するもので、Chin-Hui Lee 教授の指導を受けました。

🧬 ジョージア工科大学の前は、Jesper Tegnér 教授の進化的機械学習グループを訪問し、TSMC で混合信号 IC 設計のインターンを経験しました。





⚛️ 余談: 趣味として量子機械学習にも取り組んでおり、変分回路に基づく初の音声 [ICASSP 21] と言語理解 [ICASSP 22] を生み出し、2019 年に Xanadu AI Quantum ML Award を受賞しました。最近では LLM の量子パラメータ適応 [ICLR 25] に取り組んでいます。

チュートリアル

EMNLP 2025

Spoken Conversational Agents with Large Language Models

ボイスエージェントと、テスト時スケーリングの楽しみ。

Interspeech 2025

Efficient Adaptation in Speech Language Modeling

音声モデルのためのポストトレーニング。

Interspeech 2023

Cross-Modal Alignment for Voice Foundational Models

マルチモーダル音声と音声言語モデル。

記事

2026年7月

Inside Inkling: Audio Design

フロンティア級のオープンモデルはどう聴くのか。エンコーダフリーの音声パス(d-mel、毎秒20トークン)とインターリーブ推論を、一歩ずつ図解。