ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

免费AI数字人克隆教程:30分钟本地部署数字分身的完整指南

免费AI数字人克隆教程:30分钟本地部署数字分身的完整指南 免费AI数字人克隆教程30分钟本地部署数字分身的完整指南【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar一段素材只要10秒你对着摄像头念几句文案存下来就会得到一个数字化的自己。这就是开源项目 Duix.Avatar 的 AI 数字人克隆 主流程——本地部署、全程离线你的素材和声音样本从不离开这台机器。分身建好之后你只需要输入几百字文案它就用你自己的音色读出来口型对得上画面。不用反复录不用开麦也不用把素材交给任何云端。对需要持续产出口播视频的人来说一次录制长期产出。一分钟看懂这是一个什么本地部署数字人工具 ️Duix.Avatar 是面向内容创作者、培训讲师和独立开发者的开源数字人克隆工具包你传一段10秒左右的口播视频它同时克隆你的形象和声音之后无论输入文字还是音频都能驱动这个形象说话自动产出成品口播视频。它的核心卖点只有一句话整套流程跑在你自己的电脑上——不联网、不付费、数据完全归你。主界面只有两个入口Create Video做视频和 Create Avatar建分身下方列表分别存放你产出的作品和已克隆的数字分身模型结构一目了然。跑通一次10秒视频克隆分身的完整步骤 ️第一步先确认你的电脑要求不算多但都是硬性条件一块安装了驱动的 NVIDIA 显卡终端执行nvidia-smi能显示显卡信息为准推荐 RTX 4070 及以上32G 及以上内存本项目算力全部在本地显卡内存小了 ASR 服务可能直接起不来Windows 1019042.1526 及以上或 Ubuntu 22.04 Desktop外加最新版本的 Docker想自己编译客户端还需要 Node.js 18。磁盘方面Windows 用户需要 D 盘留 30G 以上存放模型和作品镜像文件要 100G 以上的空间默认在 C 盘不足的话可以在 Docker Desktop 里把磁盘镜像路径挪到大盘Ubuntu 用户预留 100G 空闲即可。第二步装 Docker拉三个服务镜像整套系统就三个服务对应三个现成镜像直接拉取不用自己构建语音识别guiji2025/fun-asr声音克隆guiji2025/fish-speech-ziming视频合成guiji2025/duix.avatarWindows 上先跑wsl --install装 WSL失败多试几次再wsl --update更新然后安装 Docker Desktop。首次启动时建议进入设置界面给 WSL 分配足额的内存和 CPU必要时把磁盘镜像目录指到空间更大的盘。第三步一键拉起服务端把代码拉下来后一切都在deploy目录完成git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d首次拉镜像大约 70G建议连 WiFi耐心等待 30 分钟左右。Ubuntu 用户改用docker-compose-linux.ymlNVIDIA 50 系列显卡或 30/40 系列 CUDA 12.8用户改用docker-compose-5090.yml。在 Docker 里看到 duix-avatar-asr、duix-avatar-tts、duix-avatar-gen-video 三个服务全部 Running服务端就算跑通了。第四步客户端建出你的第一个分身客户端有官方构建包不需要从源码编译Windows 双击Duix.Avatar-x.x.x-setup.exe安装Ubuntu 双击 AppImage 直接运行root 桌面需要在终端加--no-sandbox参数启动。打开客户端后点 Create Avatar上传一段 10 秒左右的清晰口播视频——正面、光线充足、必须有说话声后面会解释原因。几分钟后你的数字分身就会出现在 My Avatars 列表里。再点 Create Video输入文案第一条口播视频就出来了。能力拆解你的素材、文案和音频是怎么被处理的 沿着输入 → 处理 → 输出来看逻辑很清晰。输入文字和音频两种驱动方式文字驱动输入文案系统先用你被克隆的声音合成一段音频再拿它驱动视频音频驱动直接上传录音形象按这段音频的节奏和语调对口型。两条路在客户端是不同入口但底层走的是同一条流水线。处理三个 AI 环节接力克隆与合成其实是三个模型协作正好对应那三个 Docker 服务FunASR对素材视频的音频做语音识别把你在视频里说的话转成文字——这也是素材必须有人在说话的原因fish-speech-ziming完成声音克隆从这几秒人声里学走你的音色、节奏和语调duix.avatar做 face2face 视频合成用目标音频逐帧驱动画面的口型。客户端主进程对这三段分工写得很清楚想读源码可以从 src/main/service/ 下的model.js、voice.js、video.js入手三个文件各管一段。输出多语言口播视频数据不出本机文案支持八种语言中文、英语、日语、韩语、法语、德语、阿拉伯语、西班牙语。生成的视频保存在本地原始素材、克隆模型全程不上任何第三方服务器。也就是说一台电脑可以持续批量产出口播视频边际成本只是时间。更快更稳本地数字人调优指南 ⚡硬件层面显卡RTX 40 系综合体验最好显存吃紧的机器可以走精简路线见下内存32G 是舒适线16G 机器可能遇到服务起不来或启动极慢存储镜像和模型都放 SSD拉取和加载都会明显变快。Docker 层面给 WSL 分配足够的内存和 CPU设置界面见前文截图这是 Windows 上最常见的瓶颈deploy/docker-compose.yml里可以改服务的数据目录Windows 默认d:/duix_avatar_data按自己磁盘情况挪动硬件受限时改用docker-compose-lite.yml启动精简版只跑视频合成服务用久了记得清理旧镜像和容器避免磁盘慢慢被占满。多模型管理Create Avatar 支持注册多个分身全部收敛在客户端 My Avatars 列表里统一管理。不同场景、不同出镜人各建一个切换是点一下的事不用重建环境。避坑手册遇到问题直接照做 docker-compose up -d 连不上镜像源request canceled / timeout官方源不稳定。给 Docker 配置国内镜像源Windows 在 Docker Desktop 设置里Ubuntu 改/etc/docker/daemon.json加registry-mirrors或开代理全局模式。三个服务反复起不来先查显卡驱动。跑一下nvidia-smi没有信息就白搭——没有 NVIDIA 显卡或驱动没装好这三个服务不可能启动这是第一自查项。新增模特报错确认素材里有人在说话。无声视频、纯空镜都用不了声音克隆依赖这段人声没有它流程走不下去。克隆时 Connection refusedASR 服务启动比较慢服务端刚拉完等几分钟再操作内存不足 32G 的机器则可能是 ASR 本身没起来。口型不自然、对不上拍换素材正面、光线充足、人脸占画面大、10-15 秒音频干净无杂音。效果问题九成出在源素材。不确定问题出在哪看两类日志客户端在设置菜单里有 Open Log服务端点开每个 Docker 服务查看日志并复制重点盯报错行。更细的排查可以直接翻仓库里的常见问题文档。生态延伸谁在维护还能深挖什么 维护方Duix.Avatar 由 duix.com 团队开源维护社区更新频繁。项目同时提供本地部署适合技术型用户和 API 服务适合业务型用户两条路线按需求选择。开放 APIDocker 启动后在本地暴露了可调用端口——语音预处理与合成18180、视频合成提交与进度查询8383。客户端的调用逻辑都写在 src/main/api/f2f.js 和 src/main/api/tts.js读这两个文件就能掌握完整接口。参与方式欢迎提 Issue、提 PR也有官方技术交流群可以交流部署经验。下一步让你的数字分身跑起来最直接的动作就三步拉取仓库git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar进deploy目录拉起三个服务然后用一段10秒口播视频注册你的第一个分身。免费开源支持商用超大规模企业需签许可协议10 秒视频完成克隆服务端 30 分钟拉齐完全离线本地部署素材与声音不出本机文字、音频双驱动8 种语言文案一台 NVIDIA 显卡 Docker 就是全部前置条件去 D 盘腾出 30G 空间然后拍那段10秒的视频吧。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表