PhD student in Computer Science at The Chinese University of Hong Kong, Shenzhen, working on speech generation and generative models. Research focuses on text-to-speech, autoregressive diffusion models, preference optimization, and reinforcement-learning-based fine-tuning. Currently a research intern at ByteDance; previously built an efficient diffusion-based TTS system at NetEase. Work published at ICASSP, InterSpeech, SLT, AAAI, and ISCSLP, including an ISCSLP 2024 Best Paper award.
text-to-speechspeech synthesisautoregressive diffusion modelspreference optimization and RL fine-tuningnon-autoregressive and efficient TTSneural vocodingaccent conversiongenerative models for audio