Audio Dialogue Systems
我关心语音里的语义、节奏与情绪,以及对话如何在多轮交互中保持连贯。

PERSONAL TRANSMISSION // 017
也使用网名 prometheus。
目前主要研究音频对话系统,也持续关注生成媒体与情绪感知 AI。
继续向下声音里藏着文字没有写下的东西:节奏、情绪,还有人与人之间微妙的关系。我的研究从这里开始。
我关心语音里的语义、节奏与情绪,以及对话如何在多轮交互中保持连贯。
图像、视频与音频生成都很吸引我,尤其关心模型如何进入真实的创作流程。
希望模型不只识别一时的情绪,也能在长期交互中理解语境与关系。
我希望 AI 不只听见一句话,也能听懂说话的人。音频对话,是我选择的起点。
生成模型、可控生成,以及它们在视觉创作中的用法
机器人训练、策略优化与奖励设计
智能体如何感知真实环境,并在其中行动
语言模型与语言智能的基础方法

我也会做些游戏原型,琢磨图形学和 MMD;闲下来,就回到动画和崩坏的世界里。
无论是研究、开源项目,还是生成媒体,我都很乐意交换想法。
Feel free to reach out. (。・ω・。)ノ