最新推荐文章于 2026-09-11 17:52:41 发布 原创 于 2026-06-18 21:46:37 发布 · 348 阅读 ## 先说能做出什么 这篇带你用一个开源工具,在同一张画布上做出一个会说话、口型对得上的数字人。全程不用在出图、配音、对口型几个网站之间来回下载上传文件。用的工具叫 TongFlow,开源免费,桌面端和网页版都有。 仓库:https ://github.com/tong-io/tongflow?utm_source=csdn&utm_medium=tutorial 不想装可以直接开网页版:https://app .tongflow.com 成品长什么样,看 README 的 demo:https://github .com/tong-io/tongflow#demo-examples ## 它的思路:每个模型都是一次「模态转换」 任何一个 AI 模型,说白了其实都是在做「模态转换」:文字到图片,图片到视频,声音到文字。TongFlow 把这些转换过程全做成画布上的节点,你只用三个动作把它们串起来:加(Add)、转(Transform)、合(Combine)。节点之间支持自动连线,丢一个上去选下一步它自己就接上了,没有那些让人眼花缭乱的 CFG、采样器、随机种子等参数。 ## 准备:装好并跑通环境

1. 在 releases 页下载桌面端(macOS arm64/Intel、Windows),打开自带一个示例工作流。

> macOS 注意:当前安装包还没做苹果公证,首次打开系统如果提示软件损坏。把 App 拖进「应用程序」后,终端里跑一次: > ```bash > xattr -cr /Applications/TongFlow.app > ```

2. 点右上角积木图标打开插件 管理器,一键安装你需要的插件,装完就能用,不用重启软件。

3. 点右上角齿轮打开 Settings,填插件需要的 key(GPU 插件需要 Modal token,每个新账号每月有最高 30 美元免费 GPU 额度,跑这条流水线完全够用)。

## 正式开始:从一句话到会说话的数字人 整条流程在一张画布上完成,分两条线最后汇合。 第一条线,做出声音:

1. 加一个文字节点,写上你想讲的主题,比如「用三句话介绍一下什么是开源」。

2. 接一个文本生成节点,把主题转换成一段口播脚本。

3. 脚本接一个语音合成节点,选一个音色,跑出来就是音频。这里语音合成支持参考音色,想克隆某个声音也可以喂一段参考音频。

第二条线,做出形象:

4. 另加一个文字节点,描述你要的角色长什么样,比如「一个戴眼镜、穿深色衬衫的年轻男性,正面,柔光」。

5. 接一个图像生成节点,得到一张形象图。

汇合,做出对口型视频:

6. 把第一条线的音频和第二条线的形象图,一起连到对口型节点。

7. 点运行。对口型插件会在云端 GPU 上跑,跑完这个人就开口说话了,口型和声音对得很准。

到这里,你就在同一张画布里,直接用一行字拿到了一个开口说话的视频,中间没倒过一次文件,也没开过第二个工具。 ## 关键一步:把工作流存下来反复用 搭好别浪费。把这张图存下来,下次想做同样结构的另一条视频,把主题和角色描述换掉,切到执行模式(Execute Mode)一键把整张图跑完,不用重新从头连线。 除了在界面里跑,你还能把它导出来,直接在 Python 脚本里执行: ```python from tongflow import run_workflow result = run_workflow("digital_human.executable.json", {"topic": "介绍一下开源"}) `run_workflow` 会把整张图跑完、返回每个节点的输出,缺的插件会自动帮你装好。桌面 App 在底层也是把运行任务派发给这同一个执行核,所以脚本跑的表现和画布上点出来的是一模一样的,非常适合用来做批量自动化或者挂载到自己的服务里。 ## 它还能做什么 同一套思路,换节点就能做文生图、图生视频、文字生成音乐、整支音乐 MV、视频超分、文档转文本。模型都点名:图像 Z-Image 和 FLUX.2 Klein,视频 LTX,对口型 InfiniteTalk,音乐 ACE-Step,语音 Qwen3。因为是插件化的,你也能换成别的模型或自己接一个。有些节点(图生 3D、字幕水印去除、部分音频处理)目前还没补官方插件,README 里用 ✅ 和 ⬜ 标得很清楚:https://github.com/tong-io/tongflow#whats-defined ## 和 ComfyUI 的区别 很多人会问和 Comfy 的关系。Comfy 很好也是开源的,区别在层级:Comfy 的节点是采样器、VAE 这种底层积木,偏图像;TongFlow 的节点是一个完整能力,横跨图、视频、音频、文本、3D。代价是底层可控性不如 Comfy,它适合快速把多个模型组合出成品,不适合像素级调参。两个工具解决的不是同一个问题。 源码和下载:https://github.com/tong-io/tongflow?utm_source=csdn&utm_medium=tutorial 一个人做的早期开源项目,跟着做卡住了欢迎在评论区问,也欢迎提需求和自写插件。 标签 #人工智能