直达「 通往AGI之路 」飞书知识库 →
首页/问答列表/问答详情

哪个软件做出来的数字人最好

回答

以下是一些制作数字人效果较好的软件及相关介绍:

  • 剪映:
    • 优势:作为字节跳动旗下产品,在抖音平台广泛应用,海外版 CapCut 成绩斐然。具有声音克隆、公模数字人等 AI 功能,能在编辑器内完成脚本生成、语音克隆、数字人口播等环节。
    • 制作流程:打开剪映,添加文本到文字轨道并修改文字,点击朗读进行声音克隆,选择数字人形象并换上克隆音色,一键智能生成字幕并调整文字样式。
    • 生成数字人:在右侧窗口顶部打开“数字人”选项,选取免费合适的形象,软件会播放声音供判断,添加后可预览效果。还可增加背景图片等进行美化。
    • 下载地址:https://www.capcut.cn/https://www.capcut.com
  • Heygen:
    • 优点:人物灵活,五官自然,视频生成很快。
    • 缺点:中文人声选择较少。
    • 使用方法:点击网址注册后,进入数字人制作,选择 Photo Avatar 上传自己的照片,上传后效果在 My Avatar 处显示,点开大图后,点击 Create with AI Studio 进入制作,写上视频文案并选择配音音色,也可自行上传音频,最后点击 Submit 得到数字人视频。
  • D-ID:
    • 优点:制作简单,人物灵活。
    • 缺点:免费版下载后有水印。
    • 使用方法:点击网址,点击右上角的 Create vedio,选择人物形象,可添加自己照片或使用给出的形象,配音时可选择提供文字选择音色或直接上传音频,最后点击 Generate vedio 生成视频,打开可下载或分享。
  • KreadoAI:
    • 优点:免费,功能齐全。
    • 缺点:音色较 AI。
    • 使用方法:点击网址注册后获得 120 免费 k 币,选择“照片数字人口播”功能,点击开始创作,选择自定义照片,配音时可选择提供文字选择音色或直接上传音频,打开绿幕按钮,点击背景添加背景图,最后点击生成视频。
内容由 AI 大模型生成,请仔细甄别(powered by aily)

参考资料

方案:剪映数字人“个性化“—无限免费私模数字人

剪映作为字节跳动旗下的产品,在抖音平台上,被广泛应用于短视频的创作和编辑中。剪映海外版CapCut登顶过美国App Store,在全球各国App Store和Google Play平台上的安装总量已超过2.5亿次,在美国市场内的安装总量接近950万次。剪映的“魔力”是什么?我们不妨来盘点一下剪映已有的AI功能这六大AI功能基本上解决了我们用数字人做视频的痛点,不需要反复跳出剪映,在编辑器里就能过完成脚本生成→语音克隆→数字人口播的环节。那下面就让我带大家手把手做一个数字人口播视频剪映下载地址:[https://www.capcut.cn/](https://www.capcut.cn/)capcut下载地址:[https://www.capcut.com](https://www.capcut.com)[heading1]制作流程[content]首先我们打开剪映,然后添加一个文本到文字轨道,并修改好需要朗读的文字;然后点击朗读,并进行声音克隆,剪映的声音克隆现在只用念一句话就可以完成克隆;克隆完成后,选择喜欢的数字人形象,并把自己的克隆音色换上去;最后,一键智能生成字幕,再自行调整文字样式并校准叫完成了。[heading1]成果视频

实战: 每个人都可以用10分钟轻松制作AI换脸、AI数字人视频的方法!

[title]实战:每个人都可以用10分钟轻松制作AI换脸、AI数字人视频的方法![heading1]三、生成数字人3.1生成数字人在剪映右侧窗口顶部,我们打开“数字人”选项,选取一位免费的、适合的数字人形象,这里我选择“婉婉-青春”。当你选择一个数字人形象时,软件会马上播放出该数字人的声音。你可以判断是否是你需要的,点击右下角的“添加数字人”,就会将选择的数字人添加到当前视频中。剪映App将会根据之前提供的内容,来生成对应音视频,并添加到当前视频文件的轨道中。左下角会提示你渲染何时完成。然后你可以点击预览按钮,查看生成的数字人效果。3.2增加背景图片接下来,可以直接删除先前导入的文本内容。这是因为视频中的音频中已经包含文字内容了。鼠标点击下方代表文字的轨道,或者点击软件中间文字内容,按删除键删去文字:为了让视频更美观,我们为视频增加背景图片。当然你可以增加多个背景图片,为简化演示,这里增加1张图片。点击左上角的“媒体”菜单,并点击“导入”按钮,来选择本地的一张图片上传:我选择一张书架图片上传,然后像添加文字内容一样,点击图片右下角的加号,将这个图片添加到视频的轨道上(会覆盖数字人):此时,书架图片就会在视频轨道的下面,添加一条新轨道:为了让图片在整个视频播放的时候都显示,可以点击这个轨道最右侧的竖线,向右拖拽,直到视频的最后,也就是和视频对齐:此时,背景图片所在的轨道是选中状态。如果没选中,鼠标点击一下这个规定即可。在显示区域,拖动背景图的一个角,将图片放大到适合的尺寸,比如覆盖视频窗口。并将数字人拖动到合适的位置:

AI 数字人|一键让照片说话

优点:人物灵活,五官自然,视频生成很快。五星好评。缺点:中文的人声选择较少[heading3]使用方法[content]1.点击网址注册后,进入数字人制作,选择Photo Avatar上传自己的照片1.上传后效果如图所示,My Avatar处显示上传的照片1.点开大图后,点击Create with AI Studio,进入数字人制作1.写上视频文案并选择配音音色,也可以自行上传音频1.最后点击Submit,就可以得到一段数字人视频啦~[heading2]D-ID[content]优点:制作简单,人物灵活缺点:为了防止侵权,免费版下载后有水印[heading3]使用方法[content]1.点击上面的网址,点击右上角的Create vedio1.选择人物形象,你可以点击ADD添加你的照片,或者使用D-ID给出的人物形象1.配音时,你可以选择提供文字选择音色,或者直接上传一段音频1.最后,点击Generate vedio就可以生成一段视频啦1.打开自己生成的视频,可以下载或者直接分享给朋友~[heading2]KreadoAI[content]优点:免费(对于普通娱乐玩家,嗯这很重要),功能齐全缺点:音色很ai[heading3]使用方法[content]1.点击上面的网址,注册后获得120免费k币,这里选择“照片数字人口播”的功能1.点击开始创作,选择自定义照片1.配音时,你可以选择提供文字选择音色,或者直接上传一段音频1.打开绿幕按钮,点击背景,可以添加背景图1.最后,点击生成视频

其他人在问
用什么软件让照片说话
以下是一些可以让照片说话的软件及相关信息: Sadtalker: 开源程序,可独立使用或作为插件放入 stablediffusion。 相关链接:https://github.com/OpenTalker/SadTalker 。 整合包:夸克网盘分享的「EZAIStarterv0.9.8.zip」,链接:https://pan.quark.cn/s/1d5ca9f57f5c 。 视频教程:https://www.bilibili.com/video/BV1Dc411W7V6/?vd_source=35e62d366d8173e12669705f7aedd122 。 具体步骤:点我启动,在启动界面中选择音频、图像口型同步的下载图标;下载完毕后启动应用,会弹出独立窗口;选择 sadtalker 同步器,分别导入图片和声音,根据需求选择图片预处理方式,点击 generate ,由于涉及视频推理和转换,需做好等待准备。 生成视频长度与音频一致,制作长视频建议剪成小段分别推理后合并。 HEYGEN: 优点:人物灵活,五官自然,视频生成很快。 缺点:中文的人声选择较少。 使用方法:点击网址注册后,进入数字人制作,选择 Photo Avatar 上传自己的照片;上传后效果在 My Avatar 处显示上传的照片;点开大图后,点击 Create with AI Studio ,进入数字人制作;写上视频文案并选择配音音色,也可以自行上传音频;最后点击 Submit ,就可以得到一段数字人视频。 DID: 优点:制作简单,人物灵活。 缺点:为了防止侵权,免费版下载后有水印。 使用方法:点击上面的网址,点击右上角的 Create vedio ;选择人物形象,可以点击 ADD 添加照片,或者使用 DID 给出的人物形象;配音时,可以选择提供文字选择音色,或者直接上传一段音频;最后,点击 Generate vedio 就可以生成一段视频;打开自己生成的视频,可以下载或者直接分享给朋友。 KreadoAI: 优点:免费(对于普通娱乐玩家很重要),功能齐全。 缺点:音色很 AI 。 使用方法:点击上面的网址,注册后获得 120 免费 k 币,选择“照片数字人口播”的功能;点击开始创作,选择自定义照片;配音时,可以选择提供文字选择音色,或者直接上传一段音频;打开绿幕按钮,点击背景,可以添加背景图;最后,点击生成视频。
2024-10-22
国外可以自动生成ppt的ai网站或ai软件
以下是一些国外可以自动生成 PPT 的 AI 网站或软件: Gamma:在各种交流群中被频繁推荐,以卓越的性能和用户体验赢得广泛认可。即使是免费版本,也能生成质量很高的 PPT。从个人使用体验来看,其在内容组织、设计美观度和整体专业感方面都表现出色。网址:https://gamma.app/ 此外,还有一些其他好用的 AI PPT 工具: 美图 AI PPT:由知名图像编辑软件“美图秀秀”的开发团队推出,允许用户通过输入简单的文本描述来生成专业的 PPT 设计,包含丰富的模板库和设计元素。网址:https://www.xdesign.com/ppt/ Mindshow:一款 AI 驱动的 PPT 辅助工具,提供一系列智能设计功能,如自动布局、图像选择和文本优化等,还可能包括互动元素和动画效果。网址:https://www.mindshow.fun/
2024-10-21
哪些软件可以做数字人
以下是一些可以制作数字人的软件: 1. 剪映:在剪映右侧窗口顶部打开“数字人”选项,可选取免费且适合的数字人形象,如“婉婉青春”。添加数字人后,软件会生成对应音视频并添加到当前视频中,还可进行增加背景图片等操作。 2. HeyGen:这是一个 AI 驱动的平台,能创建逼真的数字人脸和角色,使用深度学习算法生成高质量肖像和角色模型,适用于游戏、电影和虚拟现实等应用。 3. Synthesia:这是一个 AI 视频制作平台,允许创建虚拟角色并进行语音和口型同步,支持多种语言,可用于教育视频、营销内容和虚拟助手等场景。 4. DID:这是一家提供 AI 拟真人视频产品服务和开发的公司,只需上传人像照片和输入要说的内容,平台提供的 AI 语音机器人将自动转换成语音,然后合成逼真的会开口说话的视频。 更多数字人工具请访问网站查看:https://www.waytoagi.com/category/42 。请注意,这些工具的具体功能和可用性可能会变化。在使用时,请遵守相关使用条款和隐私政策,并注意生成内容的版权和伦理责任。 此外,还可以通过以下方式实现数字人的“私有化”: 尽管剪映已有很多公模数字人,但私模数字人更受欢迎。可以使用 AI 换脸软件来完成,具体步骤如下: 1. 第一步:打开谷歌浏览器,点击链接 https://github.com/facefusion/facefusioncolab 并点击 open colab 进到程序主要运行界面,在右上角点击“代码执行程序”选择“全部运行”,无需安装和付费。点击红框对应的 URL 打开操作界面。 2. 第二步:点击“source”上传自己的照片和“target”上传之前的剪映数字人视频,保持默认参数,点击“START”就能生成。 3. 第三步:等待专属的数字人视频出炉。 有关数字人使用上的问题,欢迎在底部评论区留言交流。同时如果对数字人课程感兴趣,欢迎查看通往 AGI 之路 X AI 沃茨的《克隆你自己》课程。 在线观看第一节:https://www.bilibili.com/video/BV1yw411E7Rt/?spm_id_from=333.999.0.0
2024-10-20
AI和软件测试行业的实践想法
目前知识库中暂时没有关于 AI 和软件测试行业实践想法的相关内容。但一般来说,在软件测试行业中应用 AI 可以考虑以下几个方面: 1. 利用机器学习算法进行测试用例的自动生成和优化,提高测试覆盖度和效率。 2. 运用自然语言处理技术对测试需求和文档进行分析,提取关键信息,辅助测试计划的制定。 3. 通过 AI 模型对软件的历史缺陷数据进行学习,预测可能出现的新缺陷类型和位置。 4. 借助图像识别和语音识别等技术,实现对软件界面和交互的自动化测试。 您可以根据实际情况和具体需求,进一步探索和创新 AI 在软件测试行业中的应用。
2024-10-18
国内适合短视频脚本写作的ai软件
以下是一些适合国内短视频脚本写作的 AI 软件: 1. ChatGPT + 剪映:ChatGPT 可生成视频小说脚本,剪映能根据脚本自动分析出视频所需的场景、角色、镜头等要素,并生成对应素材和文本框架,能快速实现从文字到画面的转化,节省时间和精力。 2. PixVerse AI:在线 AI 视频生成工具,支持将多模态输入(如图像、文本、音频)转化为视频。 3. Pictory:AI 视频生成器,允许用户轻松创建和编辑高质量视频,无需视频编辑或设计经验。用户提供文本描述,Pictory 帮助生成相应视频内容。 4. VEED.IO:提供 AI 图像生成器和 AI 脚本生成器,帮助用户从图像制作视频,并规划从开场到结尾的内容。 5. Runway:AI 视频创作工具,能将文本转化为风格化的视频内容,适用于多种应用场景。 6. 艺映 AI:专注于人工智能视频领域,提供文生视频、图生视频、视频转漫等服务,用户可根据文本脚本生成视频。 这些工具各有特点,适用于不同的应用场景和需求,能够帮助内容创作者、教育工作者、企业和个人快速生成吸引人的视频内容。 此外,在制作 AI 短片时,声音部分可以使用 11labs 进行英文对白制作,国内可以使用出门问问的魔音工坊。对于剪辑,13 分钟的短片用剪映较方便,更长篇幅或追求更好效果可能需要使用 PR/FCP/达芬奇等传统剪辑软件。
2024-10-18
国内有专门做短视频脚本的ai软件
以下是一些国内专门做短视频脚本的 AI 软件: 1. ChatGPT + 剪映:ChatGPT 可生成视频小说脚本,剪映能根据脚本自动分析出视频所需的场景、角色、镜头等要素,并生成对应素材和文本框架,可快速实现从文字到画面的转化,节省时间和精力。 2. 艺映 AI:专注于人工智能视频领域,提供文生视频、图生视频、视频转漫等服务,用户可根据文本脚本生成视频。 3. 出门问问的魔音工坊:在国内可用,具有情绪调节控件。 此外,制作 AI 短片还涉及到声音制作、故事创作、剪辑等方面: 1. 声音制作:可使用 11labs 进行英文对白制作,通过标点符号改变语音效果;国内可尝试魔音工坊。 2. 故事创作:故事来源包括原创(如自身经历、梦境、想象等)和改编(如经典 IP、名著、新闻、二创等)。剧本写作可从自身或朋友经历改编入手,或对短篇故事进行改编,多与他人讨论以修改和进步。 3. 剪辑:对于 13 分钟的短片,剪映较为方便;更长篇幅可能需要使用 PR/FCP/达芬奇等传统剪辑软件。 请注意,以上内容由 AI 大模型生成,请仔细甄别。
2024-10-18
数字员工
数字员工是一种通过 AI 智能体实现的为个人提效的方式。在 WaytoAGI 的分享中,大聪明(赛博禅心作者)认为,AI 智能体就如同个人拥有的数字员工,您可以不断向其下达任务,就像老板给员工下达任务一样。每个数字员工有不同的特点和能力,下达任务时目标是否清晰以及能否被理解很重要,这考验写提示词的能力。数字员工会基于对目标的理解,按照计划不断尝试完成,并适时寻求反馈。例如句子互动就在打造大模型驱动的领先数字员工。
2024-10-21
AI数字主播
以下是关于 AI 数字主播的相关内容: 节目单方面: 节目单 1.3 中包含了多种传统艺术与 AI 技术结合的节目,如新式变脸换装秀,需要绿幕、大量服装和好身材演员,存在缺服装和场地、缺换脸大佬的问题;剪纸/皮影戏/花灯,需要传统文化串烧脚本、AI 图片诠释、AI 视频空镜和脚本串词,有想法但无人认领。 节目单 1.2 中有 AIGC 技术短片,涉及 AI 转绘和 AI 蒙版抠图等技术;AIGC 温情短片,以叙事为主;原创 RAP,包括原创 RAP、AI Raper 和视频驱动;经典节目再现,需考虑形式;猜真人,属于魔术互动类表演,涉及数字人及 AI 数字人,可参考 heygen 官网视频。 Character.ai 方面:其愿景是让每个人都能获得深度个性化超级智能,例如授课教师、游戏玩家、情感伴侣等服务都可被 AI 重构。在教育培训领域,借助大型语言模型,人工智能生成的角色可作为数字教师,如让牛顿、白居易授课,能实现一对一辅导,提供定制化学习计划和资源,提高教育效率和质量,缓解教育资源不平等问题。还可作为数字陪伴促进儿童成长。
2024-10-21
AI 圆桌论坛,讨论者是通信公司技术专家,数字业务专家,初创企业智慧城市专家,听众是对AI了解相对一般的观众,可以讨论哪些话题
以下是一些适合在您所描述的 AI 圆桌论坛中讨论的话题: 1. AI 在通信领域的应用与挑战,例如如何提升通信网络的智能化、优化频谱资源分配等。 2. 数字业务中 AI 的创新应用和潜在风险,比如个性化推荐系统的优化、数据隐私保护等。 3. 初创企业在智慧城市建设中利用 AI 的机遇和困难,像是如何获取数据资源、应对技术人才短缺等。 4. 探讨具身智能在不同领域的发展前景,如机器人、教育等。 5. 大模型如何为具身智能带来变革,以及相关的技术突破和应用案例。 6. 分析 AI 对传统行业的冲击与重塑,以及如何应对这种变化。 7. 研究 AI 在教育领域的创新模式,如个性化学习、智能辅导等。 8. 讨论 AI 技术的监管政策和伦理道德问题。 9. 分享在不同场景下(如出海业务、创新教育等)AI 的应用经验和成果。 10. 展望 AI 未来的发展趋势及其对社会经济的影响。
2024-10-20
目前做的比较好的数字人直播有哪些?
目前数字人直播在店播场景下效果较好,以下是一些相关信息: 电商直播分为达播跟店播,数字人直播在店播中的数据基本能保持跟真人一样。 数字人直播适用的品类和场景: 适用于不需要强展示的商品,如品牌食品饮料。 适用于虚拟商品,如门票、优惠券等。 不适用于促销场景。 数字人直播的盈利方式: 直接卖数字人工具软件,分实时驱动和非实时驱动两类,实时驱动价格较高,非实时效果差且价格混乱。 提供数字人运营服务,按直播间成交额抽佣。 目前业界对数字人的定义还没有统一标准,一般可分为真人驱动和算法驱动两类。真人驱动的数字人重在通过动捕设备或视觉算法还原真人动作表情,主要应用于影视行业和直播带货。
2024-10-18
数字人直播防分控要做到哪些?
以下是关于数字人直播防分控需要做到的一些方面: 在盈利方式方面: 1. 可以直接销售数字人工具软件,包括实时驱动和非实时驱动两类。实时驱动在直播时能改音频话术,真人可接管,标准零售价一年 4 6 万往上;非实时驱动一个月 600 元,效果差,类似放视频的伪直播,市场价格混乱,存在靠发展代理割韭菜的情况。 2. 提供数字人运营服务,按直播间成交额抽佣。 在适用品类和场景方面: 1. 适用于不需要强展示的商品,如品牌食品饮料;不适用于服装,因其过品快且衣服建模成本高。 2. 适用于虚拟商品,如门票、优惠券等。 3. 不适用于促销场景,这涉及主播话术、套路和调动直播间氛围的能力等。 4. 电商直播分为达播跟店播,数字人直播在店播中的效果最佳,数据基本能保持跟真人一样。 在壁垒和未来市场格局方面: 1. 从长期来看,技术上没有壁垒,但目前仍有技术门槛,单纯靠开源算法拼的东西,实时性、可用性不高,比如更真实的对口型、更低的响应延迟等。 2. 市场不会一家独大,可能有 4 5 家一线效果的公司,大多为二三线效果的公司。因为它只是工具,迁移成本低。 3. 真正把客户服务好,能规模化扩张的公司更有价值。疯狂扩代理割韭菜,不考虑客户效果的公司,售后问题会很麻烦。 4. 有资源、有业务的大平台下场,可能会带来降维打击,例如剪映马上要做,如果不仅提供数字人,还提供货品供应链、数据复盘分析等等,全环节打通会绑定商家,很难与之竞争。
2024-10-18
做PPT目前最好的ai工具是什么
目前市场上有以下一些好用的做 PPT 的 AI 工具: 1. Gamma:这是一个在线 PPT 制作网站,允许用户通过输入文本和想法提示快速生成幻灯片。它支持嵌入多媒体格式,如 GIF 和视频,以增强演示文稿的吸引力。网址:https://gamma.app/ 2. 美图 AI PPT:由知名图像编辑软件“美图秀秀”的开发团队推出。用户通过输入简单的文本描述来生成专业的 PPT 设计,包含丰富的模板库和设计元素,可根据需求选择不同风格和主题的模板,适用于多种场合。网址:https://www.xdesign.com/ppt/ 3. Mindshow:一款 AI 驱动的 PPT 辅助工具,提供一系列智能设计功能,如自动布局、图像选择和文本优化等,还可能包括互动元素和动画效果。网址:https://www.mindshow.fun/ 4. 讯飞智文:由科大讯飞推出的 AI 辅助文档编辑工具,利用科大讯飞在语音识别和自然语言处理领域的技术优势,提供智能文本生成、语音输入、文档格式化等功能。网址:https://zhiwen.xfyun.cn/ 此外,还有以下工具: 1. 爱设计 2. 闪击 3. Process ON 4. WPS AI 目前市面上大多数 AI 生成 PPT 按照如下思路完成设计和制作: 1. AI 生成 PPT 大纲 2. 手动优化大纲 3. 导入工具生成 PPT 4. 优化整体结构 推荐 2 篇市场分析的文章供参考: 1. 《》 2. 《》 请注意,内容由 AI 大模型生成,请仔细甄别。
2024-10-22
请问现在最好的用AI写公众号的AI是什么
目前没有明确的“最好”用 AI 写公众号的工具,不过可以通过以下方式利用 AI 来创作公众号文章: 1. 设计明确且具有指导性的提示词:例如“请根据我们收集的关于 OpenAI 回应马斯克言论的资讯,创作一篇既深入又易于理解的科技资讯文章。文章应该有一个吸引人的标题,开头部分要概述事件的背景和重要性,主体部分详细分析 OpenAI 的回应内容及其可能产生的影响,结尾处提出一些引人深思的问题或观点。”这样的提示词能为 AI 提供明确指导,并设定文章基本结构和内容要求,AI 会据此生成结构完整、内容丰富、观点鲜明的文章,但最终产出的内容可能需要进行微调,以符合预期和公众号风格。 2. 校对文章:虽然 AI 生成文本已相当精确,但人工校对仍不可或缺。在校对过程中,需注意内容准确性,核实信息和数据是否准确无误,引用来源是否可靠;确保表达清晰,检查文章是否流畅易读,语言是否清晰,专业术语和概念对目标读者群体是否易于理解;保证逻辑连贯,确保文章结构合理,论点和论据逻辑关系清晰,避免逻辑跳跃或混乱。 3. 利用 AI 找配图:让 AI 分析文章内容,给出配图建议和关键词,然后利用这些信息在免费图库中快速找到合适的无版权图片,提高配图效率,避免版权风险。
2024-10-22
最好的开源LLM是什么
目前开源的 LLM 有很多优秀的选择,以下为您列举一些: OPT 是表现最优秀的全开源 LLM 之一。这个拥有 1750 亿参数的模型的发布附带了代码,并在公开可用的数据集上进行了训练。 ChatGLM 是中文领域效果最好的开源底座模型之一,针对中文问答和对话进行了优化。经过约 1T 标识符的中英双语训练,辅以监督微调、反馈自助、人类反馈强化学习等技术的加持。 VisualGLM6B 是一个开源的,支持图像、中文和英文的多模态对话语言模型,语言模型基于 ChatGLM6B,具有 62 亿参数;图像部分通过训练 BLIP2Qformer 构建起视觉模型与语言模型的桥梁,整体模型共 78 亿参数。依靠来自于 CogView 数据集的 30M 高质量中文图文对,与 300M 经过筛选的英文图文对进行预训练。 ChineseLLaMAAlpaca 是在原版 LLaMA 的基础上扩充了中文词表并使用了中文数据进行二次预训练,支持本地 CPU/GPU 部署。 需要注意的是,对于“最好的开源 LLM”的评判标准因人而异,取决于具体的应用场景和需求。
2024-10-19
目前最好用的机关公文写作大模型或智能体
目前在机关公文写作方面表现较好的大模型或智能体有: 智谱清言:由智谱 AI 和清华大学推出,基础模型为 ChatGLM 大模型。在工具使用排名国内第一,在计算、逻辑推理、传统安全能力上排名国内前三。更擅长专业能力,但在代码能力上还有优化空间,知识百科方面稍显不足。可应用场景广泛,在 AI 智能体方面相关的应用,包括任务规划、工具使用及长文本记忆相关场景表现出色,在较复杂推理应用上效果不错,也适用于广告文案、文学写作等。 此外,在大模型中,智能体是大模型的一个重要发展方向。智能体可以理解为在大模型(如 LLM)基础上增加了工具、记忆、行动、规划等能力。目前行业里主要用到的如 langchain 框架,能通过代码或 prompt 的形式将 LLM 与 LLM 之间以及 LLM 与工具之间进行串接。
2024-10-18
我想找一些具有「图片理解」能力的模型,最好是国内的
以下是一些具有“图片理解”能力的国内模型: 1. Gemini 模型:在各种图像理解基准测试中表现出色,如在表 7 中的各项测试中是最先进的,在回答自然图像和扫描文档的问题,以及理解信息图表、图表和科学图解等任务中性能强大。在 zeroshot 评估中表现优于其他模型,在多学科的 MMMU 评估基准测试中也取得了最好的分数。 2. 国内大模型: 北京企业机构:百度(文心一言)https://wenxin.baidu.com 、抖音(云雀大模型)https://www.doubao.com 、智谱 AI(GLM 大模型)https://chatglm.cn 、中科院(紫东太初大模型)https://xihe.mindspore.cn 、百川智能(百川大模型)https://www.baichuanai.com/ 上海企业机构:商汤(日日新大模型)https://www.sensetime.com/ 、MiniMax(ABAB 大模型)https://api.minimax.chat 、上海人工智能实验室(书生通用大模型)https://internai.org.cn 3. 智谱·AI 开源模型: CogAgent18B:基于 CogVLM17B 改进的开源视觉语言模型,拥有 110 亿视觉参数和 70 亿语言参数,支持 11201120 分辨率的图像理解,具备 GUI 图像的 Agent 能力。 CogVLM17B:强大的开源视觉语言模型,在多模态权威学术榜单上综合成绩第一,在 14 个数据集上取得了 stateoftheart 或者第二名的成绩。 Visualglm6B:开源的支持图像、中文和英文的多模态对话语言模型,语言模型基于 ChatGLM6B,具有 62 亿参数;图像部分通过训练 BLIP2Qformer 构建起视觉模型与语言模型的桥梁,整体模型共 78 亿参数。 RDM:Relay Diffusion Model,级联扩散模型,可以从任意给定分辨率的图像快速生成,而无需从白噪声生成。
2024-10-16
国内可直接编辑或创建图像文件的最好用AI有哪些?
以下是一些国内可直接编辑或创建图像文件且好用的 AI 工具: 1. 无界 AI:可用于快速制作海报底图,并完成主题海报排版。操作流程包括确定主题与文案、选择风格与布局、生成与筛选、配文与排版。 2. Artguru AI Art Generator:在线平台,能生成逼真图像,为设计师提供灵感,丰富创作过程。 3. Retrato:将图片转换为非凡肖像,有 500 多种风格选择,适合制作个性头像。 4. Stable Diffusion Reimagine:通过稳定扩散算法生成精细、具有细节的全新视觉作品。 5. Barbie Selfie Generator:专为喜欢梦幻童话风格的人设计,可将上传的照片转换为芭比风格。 6. 可灵:由快手团队开发,用于生成高质量的图像和视频,但价格相对较高。 7. 通义万相:在中文理解和处理方面表现出色,用户可选择多种艺术和图像风格,生成图像质量较高,操作界面简洁直观,用户友好度高,且目前免费,每天签到获取灵感值即可。但存在一定局限性,如某些类型的图像因国内监管要求无法生成,处理非中文语言或国际化内容可能不够出色,处理多元文化内容时可能存在偏差。
2024-10-15