Speech generation, generative models, and efficient inference

Zhijun Liu

Shenzhen, China

PhD student in Computer Science at The Chinese University of Hong Kong, Shenzhen, working on speech generation and generative models. Research focuses on text-to-speech, autoregressive diffusion models, preference optimization, and reinforcement-learning-based fine-tuning. Currently a research intern at ByteDance; previously built an efficient diffusion-based TTS system at NetEase. Work published at ICASSP, InterSpeech, SLT, AAAI, and ISCSLP, including an ISCSLP 2024 Best Paper award.

text-to-speechspeech synthesisautoregressive diffusion modelspreference optimization and RL fine-tuningnon-autoregressive and efficient TTSneural vocodingaccent conversiongenerative models for audio
2026

VGPO: Fine-tuning Speech Autoregressive Diffusion Models with Value Guided Policy Optimization

Zhijun Liu, Dongya Jia, Yinghao Aaron Li, Chenpeng Du, Xiaobin Zhuang, Zhuo Chen, Yuping Wang, Yuxuan Wang, Shuai Wang, Haizhou Li

SLT 2026 / Accepted

2026

Direct Preference Optimization for Speech Autoregressive Diffusion Models

Zhijun Liu, Dongya Jia, Xiaoqiang Wang, Chenpeng Du, Shuai Wang, Zhuo Chen, Haizhou Li

InterSpeech 2026 / Accepted

2025

E1 TTS: Simple and Fast Non-Autoregressive TTS

Zhijun Liu, Shuai Wang, Pengcheng Zhu, Mengxiao Bi, Haizhou Li

ICASSP 2025

2024

Autoregressive Diffusion Transformer for Text-to-Speech Synthesis

Zhijun Liu, Shuai Wang, Sho Inoue, Qibing Bai, Haizhou Li

arXiv 2406.05551 / Preprint

2024

Diffusion-Based Method with TTS Guidance for Foreign Accent Conversion

Qibing Bai, Shuai Wang, Zhijun Liu, Mingyang Zhang, Wei Rao, Yannan Wang, Haizhou Li

ISCSLP 2024

ISCSLP 2024 Best Paper

2023

DiffVoice: Text-to-Speech with Latent Diffusion

Zhijun Liu, Yiwei Guo, Kai Yu

ICASSP 2023

2023

UniCATS: A Unified Context-Aware Text-to-Speech Framework with Contextual VQ-Diffusion and Vocoding

Chenpeng Du, Yiwei Guo, Feiyu Shen, Zhijun Liu, Zheng Jiang, Xie Chen, Shuai Wang, Zhang Hui, Kai Yu

AAAI 2023

2020

Neural Homomorphic Vocoder

Zhijun Liu, Kuan Chen, Kai Yu

InterSpeech 2020

2019

SJTU Entry in Blizzard Challenge 2019

Bo Chen, Kuan Chen, Zhijun Liu, Zhihang Xu, Songze Wu, Chenpeng Du, Muyang Li, Sijin Li, Kai Yu

Blizzard Challenge Workshop

Top Seed Research Intern / ByteDance

Shenzhen, China

With Zhuo Chen, Dongya Jia

  • Research on reinforcement-learning-based fine-tuning of autoregressive diffusion TTS models.
  • Worked on speech generation and text-to-music generation, with emphasis on post-training of generative audio models.
  • Submitted two papers from this line of work.

Research Intern / NetEase

Hangzhou, China

With Pengcheng Zhu

  • Delivered an efficient diffusion-based text-to-speech system with strong audio quality.
  • Contributed to a paper accepted at ICASSP 2025.

PhD Computer Science / The Chinese University of Hong Kong, Shenzhen

Shenzhen, China

Advisors: Prof. Haizhou Li, Prof. Shuai Wang

Master of Engineering Computer Science and Technology / Shanghai Jiao Tong University

Shanghai, China

Advisors: Prof. Kai Yu

Bachelor of Engineering Computer Science and Technology / Shanghai Jiao Tong University

Shanghai, China
  • 2024ISCSLP 2024 Best PaperDiffusion-Based Method with TTS Guidance for Foreign Accent Conversion