Navigate to WaytoAGI Wiki →
Home/Question List/Question Detail

实景数字人

Answer

以下是关于实景数字人的相关信息:

AI 数字人类型和应用场景

  1. 二维/三维虚拟人:用于游戏、IP 品牌(如柳夜熙)、内容创作(http://AI.talk)等。
  2. 真人形象数字人:用于直播卖货,营销/投流广告视频录制(如 Heygen)、语言学习(如 CallAnnie)等。

AI 数字人的价值

  1. 代替人说话,提升表达效率和营销效率。例如真人无法 24 小时直播,但数字人可以。
  2. 创造真实世界无法完成的对话或交流。比如 AI talk 的实验探索,复活故去的亲人等。

AI 数字人面临的问题

  1. 平台限制:目前数字人水平参差不齐,平台担心直播观感,有一定打压限制。比如抖音出台一些标准,微信视频号容忍度更低,人工检查封号。
  2. 技术限制:形象只是皮囊,智能水平和未来想象空间依赖大模型技术提升。
  3. 需求限制:直播带货是落地场景,但不够刚。“懂得都懂”的刚需场景,国内搞不了。目前更多是体验新鲜感。
  4. 伦理/法律限制:存在声音、影像版权等问题,比如换脸、数字永生等。

如何构建高质量的 AI 数字人

  1. 构建数字人灵魂:让数字人具备各种智能,如记住个人信息、充当个人助手、在某个领域具备专业知识、处理复杂任务等。实现这些能力有几个工程关键点,包括写像人一样思考的 AI Agent,面临记忆模块、工作流模块、工具调用模块的构建挑战;灵魂部分驱动躯壳的实现,要定义灵魂部分的接口,躯壳通过 API 调用,注意包含情绪的语音表达以及保证躯壳的口型、表情、动作和语音的同步及匹配,目前主流方案只能做到预设一些表情动作,再做逻辑判断来播放预设,语音驱动口型相对成熟但闭源;要解决实时性问题,由于算法部分庞大,几乎不能单机部署,特别是大模型部分,会涉及网络耗时和模型推理耗时,低延时是亟需解决的问题;实现多元跨模态,不仅是语音交互,还可根据需求添加其他感官,如视觉通过添加摄像头数据和 CV 算法做图像解析等;处理拟人化场景,如插话、转移话题等情况,实现工程上的丝滑处理。
  2. 虚拟数字人的分类和驱动方式:从驱动层面分为中之人驱动和 AI 驱动。中之人驱动运用动作捕捉和面部捕捉技术实现交互,有上限,缺乏高并发和量产化能力。AI 驱动使用 AI 技术创建、驱动和生成内容,赋予交互能力。从应用层面分为服务型、表演型和身份型。服务型虚拟数字人如虚拟主播、助手、教师、客服和医生等,为物理世界提供服务。表演型如虚拟偶像用于娱乐、影视等。身份型是物理世界“真人”的数字分身,在元宇宙中有广泛应用。

以上讨论的虚拟数字人是 AI 驱动的,主要集中于服务型虚拟数字人,强调其具有功能属性,隶属于业务层。

Content generated by AI large model, please carefully verify (powered by aily)

References

7月2日 张晟、汗青讨论数字人

1.二维/三维虚拟人:用于游戏、IP品牌(柳夜熙)、内容创作([http://AI.talk](https://t.co/EM7nnuMohc))等。2.真人形象数字人:用于直播卖货,营销/投流广告视频录制(Heygen)、语言学习(CallAnnie)等等。[heading2]AI数字人的价值是什么?[content]1.代替人说话,提升表达效率和营销效率。比如真人做不到24小时直播,但数字人可以。2.创造真实世界无法完成的对话或交流。例如AI talk的实验探索,复活故去的亲人等。[heading2]AI数字人面临的问题?[content]平台限制:目前数字人水平参差不齐,平台担心直播观感,有一定打压限制。比如抖音出台一些标准,而微信视频号容忍度更低,人工检查封号。技术限制:形象只是皮囊,智能水平和未来想象空间,依赖大模型技术提升。需求限制:直播带货算个落地场景,但不刚。“懂得都懂”的刚需场景,国内搞不了。目前更多是体验新鲜感。伦理/法律限制:声音、影像版权等,比如换脸、数字永生等等。

AI 数字人-定义数字世界中的你

[title]AI数字人-定义数字世界中的你[heading2]二、如何构建高质量的AI数字人[heading4]2.2构建数字人灵魂有了数字人躯壳,我们就需要构建数字人的灵魂,让数字人具备各种智能,比如记得你的个人信息,充当你的个人助手;在某个领域具备更专业的知识;能处理复杂的任务等等。这些能力实现有以下几个需要注意的工程关键点:1.AI Agent:我们要想数字人像人一样思考就需要写一个像人一样的Agent,工程实现所需的记忆模块,工作流模块、各种工具调用模块的构建都是挑战;2.驱动躯壳的实现:灵魂部分怎样去驱动躯壳部分,我们可以将灵魂部分的所有接口定义出来,然后躯壳部分通过API调用,调用方式可以是HTTP、webSocket等等,视躯壳部分的实现而定。但包含情绪的语音表达以及如何保证躯壳的口型、表情、动作和语音的同步及匹配,目前主流方案只能做到预设一些表情动作,再做一些逻辑判断来播放预设,语音驱动口型相对来说成熟一些,但都是闭源的,效果可以参考Nvidia的Audio2Face(https://www.nvidia.cn/omniverse/apps/audio2face/)或则Live Link Face(Iphone APP)+ Face AR Sample(UE);3.实时性:由于整个数字人的算法部分组成庞大,几乎不能实现单机部署,特别是大模型部分,所以算法一般会部署到额外的集群或者调用提供出来的API,这里面就会涉及到网络耗时和模型推理耗时,如果响应太慢就会体验很差,所以低延时也是亟需解决的一个问题。4.多元跨模态:仅仅是语音交互的数字人是远远不够的,人有五感(听觉、视觉、嗅觉、触觉、味觉),听觉只是其中一种,其他的感官可以根据实际需求来做,比如视觉我们可以通过添加摄像头数据来获取数据,再通过系列CV算法做图像解析等;5.拟人化场景:我们正常和人交流的时候不是线性对话,会有插话、转移话题等情况,这些情景如何通过工程丝滑处理。

虚拟数字人,好看的皮囊有什么价值?

虚拟数字人是通过各种技术创造出来的,具有多种人类特征,比如外观、行为和思想,被呈现为虚拟形象。从驱动层面来说,虚拟数字人可以分为两类:中之人驱动和AI驱动。其中,中之人驱动运用动作捕捉和面部捕捉技术实现虚拟人与现实的交互;而AI驱动则使用AI技术创建、驱动和生成虚拟人的内容,从而赋予其感知和表达等交互能力。中之人驱动的数字人有其上限,缺乏高并发和量产化的能力,可以看做是真人“披着虚拟外皮”的产物。ChatGPT的出现催动了新一轮AI技术的浪潮,不少虚拟数字人厂商都在争相宣称自己的产品将会接入ChatGPT,赋予数字人智慧的大脑。只有通过AI技术让虚拟人“虚拟”得彻底,才能够释放出更高的价值。从应用层面来看,虚拟数字人可分为服务型、表演型和身份型三大类。服务型虚拟数字人,如虚拟主播、虚拟助手、虚拟教师、虚拟客服和虚拟医生等,主要为物理世界提供各种服务。典型代表有冯小殊、崔筱盼、观君等。表演型虚拟数字人,如虚拟偶像等,主要用于娱乐、影视等场景,例如虚拟偶像演唱会。典型代表有洛天依、AYAYI、柳夜熙等。身份型虚拟数字人是物理世界的“真人”进入虚拟世界的数字分身,在元宇宙中,数字分身有广泛的应用场景。本文讨论的虚拟数字人是AI驱动的,主要集中于服务型虚拟数字人。强调服务型虚拟数字人具有功能属性,隶属于业务层。文章仅探讨AI创造出的虚拟“皮囊”可以带来什么价值。

Others are asking
我有一份青年创新讲稿,想用自己的数字形象和我自己的声音讲解,背景要做一些和讲稿内容相符的视频。什么工具最称手呢?
以下是一些适合您需求的工具: 1. HeyGen:这是一个 AI 驱动的平台,能创建逼真的数字人脸和角色。它运用深度学习算法生成高质量肖像和角色模型,适用于游戏、电影和虚拟现实等领域。 2. Synthesia:一个 AI 视频制作平台,允许创建虚拟角色并进行语音和口型同步,支持多种语言,可用于教育视频、营销内容和虚拟助手等场景。 3. DID:一家提供 AI 拟真人视频产品服务和开发的公司,只需上传人像照片和输入要说的内容,平台的 AI 语音机器人会自动转换成语音,然后合成逼真的会开口说话的视频。 此外,还有以下工具供您参考: 1. 开源且适合小白用户的工具:具有一键安装包,无需配置环境,简单易用。其功能包括生成数字人视频,支持语音合成和声音克隆,操作界面中英文可选,系统兼容 Windows、Linux、macOS,模型支持 MuseTalk(文本到语音)、CosyVoice(语音克隆)。使用时需下载 8G+3G 语音模型包,启动模型即可。相关链接:GitHub: 2. Google Veo 2:能生成逼真的 Vlog 视频,效果接近真实,几乎难以分辨,适合创作和内容制作。相关链接: 请注意,这些工具的具体功能和可用性可能会随时间和技术发展而变化。在使用时,请确保遵守相关使用条款和隐私政策,并注意对生成内容的版权和伦理责任。
2025-04-02
数字人直播怎么做
数字人直播的相关内容如下: 盈利方式: 直接卖数字人工具软件,分实时驱动和非实时驱动两类。实时驱动在直播时能改音频话术,真人接管,市面价格在一年 4 6 万往上(标准零售价)。非实时一个月 600 元,效果差,类似放视频的伪直播,市场价格混乱,靠发展代理割韭菜。 提供数字人运营服务,按直播间成交额抽佣。 适用品类和场景: 适用于不需要强展示的商品,如品牌食品饮料;不适用于服装,过品快,衣服建模成本高。 适用于虚拟商品,如门票、优惠券等。 不适用于促销场景,这涉及主播话术、套路,调动直播间氛围能力等。 电商直播分为达播跟店播,数字人直播跑下来效果最好的是店播,数据基本能保持跟真人一样。 壁垒和未来市场格局: 时间拉长,技术上没壁垒。但目前看仍有技术门槛,单纯靠开源算法拼的东西,实时性、可用性不高。比如更真实的对口型,更低的响应延迟等。 不会一家独大,可能 4 5 家一线效果,大多二三线效果公司。因为它只是工具,迁移成本低。 真正把客户服务好,能规模化扩张的公司更有价值。疯狂扩代理割韭菜,不考虑客户效果的公司,售后问题很麻烦。 有资源、有业务的大平台下场,可能会带来降维打击,例如剪映马上要做,如果不仅提供数字人,还提供货品供应链、数据复盘分析等等,全环节打通会绑定商家,很难打。 数字人的简介:数字人是指运用数字技术创造出来的人,虽然现阶段不能做到像科幻作品中的人型机器人一样具备高度智能,但已在生活各类场景中触手可及,且随着 AI 技术发展,正在迎来应用爆发。目前业界没有关于数字人的准确定义,一般可根据技术栈不同分为两类,一类是由真人驱动的数字人,重在通过动捕设备或视觉算法还原真人动作表情,主要应用于影视行业以及现下火热的直播带货,其表现质量与手动建模精细程度及动捕设备精密程度直接相关,不过随着视觉算法进步,现在在没有昂贵动捕设备情况下也可通过摄像头捕捉到人体骨骼和人脸关键点信息,从而做到不错的效果。
2025-04-01
用剪映做数字人短视频怎么收费的
用剪映制作数字人短视频的收费情况如下: 制作数字人视频本身免费。 数字人换脸方面,经实际测试,1 分 28 秒的视频,总转换时间约 200 秒,换脸成本约 0.8 元。 直播的使用可能需要收费,而短视频可以通过购买邮箱注册使用免费时长或直接购买会员版。 另外,关于数字人相关的其他信息: 直接卖数字人工具软件,实时驱动的一年价格在 4 6 万往上(标准零售价),非实时驱动的一个月 600 元,效果较差且市场价格混乱。 提供数字人运营服务,按直播间成交额抽佣。 数字人直播适用于不需要强展示的商品(如品牌食品饮料)、虚拟商品,店播效果较好,不适用于促销场景。 数字人直播在技术上未来时间拉长可能没有壁垒,目前仍有技术门槛,不会一家独大,有资源、有业务的大平台下场可能带来降维打击。
2025-04-01
市面上一些数字人软件交费成为会员后,以后做数字人短视频还要付费吗
市面上不同的数字人软件在付费成为会员后的收费情况有所不同。 例如,在某些电商场景中,使用数字人结合产品做短视频,可通过购买邮箱注册使用免费时长或直接购买会员版。直播应用可能需要收费,而短视频方面,有的可以利用免费时长,有的则需要购买会员。 像可灵这款视频模型,于 7 月 24 日发布会员体系,结束免费内测。使用其生成视频会消耗灵感值,使用高级功能和获取更多灵感值需付费成为 VIP 用户。非 VIP 用户只能使用普通功能,每天登录送 66 灵感值(有效期一天),大约可生成 6 个视频。会员充值限时一周半价,黄金会员 33 元/单月、396 元/一年,铂金会员 133 元/单月、1596 元/一年,钻石会员 333 元/单月、3996 元/一年。 另外,对于剪映数字人的“私有化”,尽管剪映有很多公模数字人,但私模数字人更受欢迎。可以用 AI 换脸软件完成最后一步,如通过谷歌浏览器打开特定链接进行操作,注意需要谷歌账号(可通过淘宝或特定平台购买)。 总之,不同数字人软件的收费规则各异,具体还需根据您使用的软件来确定。
2025-04-01
有哪些免费好用的制作数字人短视频的软件?推荐一下
以下是一些免费好用的制作数字人短视频的软件及相关介绍: 1. 剪映: 在剪映右侧窗口顶部,打开“数字人”选项,选取免费且适合的数字人形象,如“婉婉青春”。选择数字人形象时会播放其声音,可判断是否需要,点击右下角“添加数字人”将其添加到当前视频中,软件会生成对应音视频并添加到轨道中。左下角会提示渲染完成时间,可点击预览查看效果。 为让视频更美观,可删除先前导入的文本内容,通过点击左上角“媒体”菜单并“导入”按钮选择本地图片作为背景,将图片添加到视频轨道上,并将轨道右侧竖线向右拖拽至与视频对齐。 2. HEYGEN: 优点:人物灵活,五官自然,视频生成很快。 缺点:中文人声选择较少。 使用方法:点击网址注册后,进入数字人制作,选择Photo Avatar上传自己的照片,上传后效果在My Avatar处显示,点开大图后,点击Create with AI Studio进入制作,写上视频文案并选择配音音色,也可自行上传音频,最后点击Submit得到数字人视频。 3. DID: 优点:制作简单,人物灵活。 缺点:免费版下载后有水印。 使用方法:点击网址,点击右上角Create vedio,选择人物形象,可点击ADD添加照片或使用给出的形象,配音时可选择提供文字选择音色或直接上传音频,最后点击Generate vedio生成视频,打开生成的视频可下载或分享。 4. KreadoAI: 优点:免费,功能齐全。 缺点:音色很AI。 使用方法:点击网址注册后获得120免费k币,选择“照片数字人口播”功能,点击开始创作,选择自定义照片,配音时可选择提供文字选择音色或直接上传音频,打开绿幕按钮,点击背景添加背景图,最后点击生成视频。
2025-04-01
新手小白怎么做自己的数字人来做自媒体短视频
以下是新手小白制作数字人用于自媒体短视频的方法: 1. 生成数字人: 在剪映右侧窗口顶部,打开“数字人”选项,选取免费且适合的数字人形象,如“婉婉青春”。软件会播放数字人的声音,可判断是否需要,点击右下角“添加数字人”将其添加到当前视频中,左下角会提示渲染完成时间,完成后可点击预览查看效果。 2. 增加背景图片: 删除先前导入的文本内容,为视频增加背景图片。点击左上角“媒体”菜单,点击“导入”按钮选择本地图片上传,如一张书架图片,点击图片右下角的加号将其添加到视频轨道上(会覆盖数字人)。点击轨道最右侧的竖线向右拖拽,直到与视频对齐。 3. 增加字幕: 点击文本智能字幕识别字幕,点击开始识别,软件会自动将文字智能分段并形成字幕。 4. 扣像结合背景: 去剪映里面把数字人扣下来,导入视频,点击画面选择抠像,点击智能扣像,调整到合适的大小和位置。 5. 添加字幕和音乐: 智能识别字幕,可搜索添加音乐或手动添加自己喜欢的音乐。 至此,数字人视频就完成了。点击右上角的“导出”按钮,导出视频以作备用。如果希望数字人换成自己希望的面孔,需要用另一个工具来进行换脸。 另外,在虚拟数字人结合产品做视频时: 1. 第一步:添加产品/介绍背景。如有自己的视频/图片素材可用自己的,没有则可根据搜索添加。 2. 第二步:扣像结合背景。在剪映中把数字人扣下来,导入视频进行智能扣像,调整大小和位置。 3. 第三步:添加字幕和音乐。智能识别字幕,搜索添加或手动添加音乐。 这样就可以根据需求结合图片生成需要的视频,用于带货或讲解产品,也可应用在直播,但直播可能需要收费,短视频可通过购买邮箱注册使用免费时长或直接购买会员版。
2025-04-01