国际语音语言生成技术研究院
研究
研究/产学官合作
参与机构
- 爱丁堡大学
- 国立信息研究所
- 名古屋大学
- 东京都立大学
- 爱知工业大学
- 科技语音有限公司
- 林纳有限公司
安装周期
2022 年 4 月 1 日起2027 年 3 月 31 日
研究员代表
李恭真教授
研究人员名单
- (主任)Kyojin Lee教授
- 南角义彦副教授
- 山本大辅副教授
- 坂木真司副教授
- 桥本耀副教授
- 上野清助理教授
- 德田敬一客座教授
- 高木真司客座副教授
- 吉村天庆客座助理教授
- 户田智树名古屋大学(客座教授)
- Steve Renals CSTR(客座教授),爱丁堡大学
- 爱丁堡西蒙金大学 CSTR(客座教授)
- 山岸淳一国立信息研究所(客座教授)
- 全秉河(客座教授)
- 盐田沙也香东京都立大学(客座副教授)
- 玉森聪爱知工业大学(客座副教授)
- Keiichiro Oura Technospeech Co, Ltd(客座副教授)
- Kazuhiro Nakamura Rakuten Group, Inc(客座副教授)
- Kei Sawada Rinna Co, Ltd(客座助理教授)
- Yukiya Houno SB Intuitions Co, Ltd(外部研究员)
研究主题概述
这项研究的目的是“建立一种基于深度生成模型的语音/音频信号生成技术”,可以自由地生成超高质量的语音/音频信号。传统的数字信号处理理论已被广泛传播并确立为语音和音频信号处理相关研究领域最基本的思维方式,但其性能受到简单模型结构的限制。然而近年来,随着WaveNet等可以直接处理音频波形的深度学习技术的出现,这种情况正在彻底改变。以往的语音波形建模方法主要基于以离散时间线性时不变系统为前提的数字信号处理理论,但WaveNet等深度神经网络(DNN)可以直接生成高质量的语音波形,是包含非线性元素的信号生成模型,可能会带来前所未有的突破。在此背景下,本研究旨在通过概述和整理近年来技术快速创新的基于深度学习的语音波形直接建模方法,并结合传统方法的优点,建立一种可以成为下一代标准的语音波形生成方法。
未来发展

联系信息
| 联系信息 | V体育研究生院信息工程系李恒信 |
|---|
