多模态技术的协同表现：从文本生成、语音合成到口型同步综合测评

charon8778

已于 2024-12-16 11:09:40 修改

阅读量1.1k

点赞数 21

分类专栏：虚幻引擎游戏开发虚幻引擎AI chatBot 文章标签：人工智能游戏引擎

于 2024-10-22 01:21:28 首次发布

本文链接：https://blog.csdn.net/charon8778/article/details/143134511

版权

虚幻引擎游戏开发同时被 2 个专栏收录

33 篇文章

订阅专栏

虚幻引擎AI chatBot

11 篇文章

订阅专栏

本文是针对多模态对话系统核心技术栈的使用效果和测评整理。

内容基于用户体验，侧重于从使用者角度出发，讨论实际操作中的技术的易用性、输出效果如文本的连贯性、语音的自然度、口型同步的准确性等。不涉及具体算法架构的分析。

文本	GPT	千帆	Claude
TTS	Elevenlabs	讯飞	GCP（Google cloud Platform）（convai内置)
lipsync	MetahumanSDK	ConvAI自研	Audio to face

对比分析

文本

GPT

GPT全面能力比千帆更强文字处理这块差不多
GPT的知识库比较大并且敏感词限制很少/千帆的文心有敏感词设置，发布大模型经过备案审核。

千帆

最大的差异，千帆比GPT便宜
文言文中国文化等本土内容，千帆更头部

Claude （Claude与GPT分析对比，图源网络）

TTS

（仅中文语音分析）

Elevenlabs:有优质的台湾语调语音库，内陆语音库也还行。

讯飞：不支持convAI第三方集成，需要企业对接。本身有明显的“的地得”不分得问题。

GCP（Google cloud Platform）：难听（指中文）。（metahuman内置的voice ID，google和Azure，whatever，也很难听）气口不对，声调错误（阴平阳平上声去声不分），甚至会读错字

克隆定制声音

D-ID studio支持克隆自己的声音。可以把定制的克隆声音上传到Elevenlabs的community语音库。

Lipsync

3D Lipsync：驱动三维模型口型动画

Metahuman SDK：动画总体有非常多的bug：升级了pricing plan仍然有动画中断问题（会在嘴张着的情况停止讲话/ 身首分离的问题）

convai自研：有audio2face runtime 百分之七八十的效果，完全免费。

Audio2Face流式：（可以集成在ConvAI中）企业版年费40w刀

2D Lipsync：驱动2D照片口型

D-ID studio

阿里云live portrait

以上工具实现照片转视频数字人。支持文本驱动（生成文字）和音频驱动（上传已有录音）

附：眼神主动控制技术，为眼球增加一些自然运动

综合流程：

文本	GPT	千帆	Claude
TTS	Elevenlabs	讯飞	GCP（Google cloud Platform）（convai内置)
lipsync	MetahumanSDK	ConvAI自研	Audio to face

个人用户可以使用“GPT-Elevenlabs-ConvAI”的技术栈组合。均有免费额度。

企业用户要求最佳效果的技术栈组合可以参考“GPT->定制克隆声音Elevenlabs驱动->ConvAI-Audio to face runtime lipsync”

Reallusion建议：

音色

切换音色：convai的协同表现非常好，但第三方API集成只支持Elevenlabs，需要使用付费套餐，但价格偏低廉。

Monthly interaction of different pricing plans

禁止词

You can use Elevenlabs voices in Convai. There are 2 ways to access Elevenlabs voices. First, your Convai plan must be a Gamer plan or higher. However, each plan has a separate ElevenLabs Interaction quota. ElevenLabs Quota is as in the screenshot I shared below. In this way, you can access ElevenLabs voices in the Character Voices section in Convai. Another method is to connect your ElevenLabs account. However, your Elevenlabs account must have a Pro plan or higher. This way you can also add custom ElevenLabs voices, and your ElevenLabs quota is the same as the quota on your account. Documentation: https://docs.convai.com/api-docs/plugins-and-integrations/elevenlabs-api-integration A small note, this way you can't use Convai's Elevenlabs voices, you need to upgrade your Convai plan. So when you connect the Elevenlabs API, everything related to Elevenlabs is connected to your Elevenlabs account.

convai不支持屏蔽关键词，需要去人设设置里告诉它不说某些词语，但不是强制屏蔽。

https://zh.wikipedia.org/wiki/%E6%AD%A7%E8%A7%86%E8%AF%AD

口癖

可以设置口癖如“这样子哦”“有啦”“真的假的？”“不好意思”“对啊/对啦”“没关系”“还好啦”“吼”“咩”。最好需要在人设里给详细解释：

“这样子哦”

这是一种表示理解或回应对方说话的口头禅，常常用在对话中表达对信息的接收或共鸣感。

“有啦”

台湾人常用“有啦”来强调某件事的存在或发生，例如：“我有做啦！”表示自己确实做了某事。

“真的假的？”

表示惊讶、怀疑或不确定的回应，类似于大陆的“真的吗？”。

“不好意思”

这在台湾不仅用于道歉，常常也用作礼貌的开场白或表示客气。例如，在请求帮助或打扰别人时，台湾人会说“不好意思”来显得更礼貌。

“对啊/对啦”

用于表示同意或附和，尤其是在对方表达观点时，台湾人会用“对啊”或“对啦”来表示赞同。

“没关系”

表示不介意、不在意，类似于“没事”、“无所谓”。这句话在台湾人的日常对话中非常常见，用来缓解尴尬或表示宽容。

“还好啦”

表示某件事情还算过得去、没有太大问题，常用来回应别人对自己状态或事情的询问。

“吼”

语气助词，用来加重语气或表达抱怨。例如：“你怎么这样吼？”有时带有一点撒娇或不满的意思。

“咩”

也是语气助词，常出现在句尾，用来表达无奈或调皮的感觉，例如：“我也不知道咩。”