Seedance 2.0 原理拆解 —— 从第一性原理讲清 视频生成、声音合成、音画同步与导演分镜这四件事, 到底是靠什么机制成立的。
讲原理之前先说清楚一件事:字节没有公开 Seedance 2.0 的架构。所以本 deck 的每一条机制, 要么来自字节自己写下的口径,要么来自同构的公开论文 —— 两者会明确标注,不混为一谈。
先把整条链看一遍,后面四章分别钻进其中一段。注意两条分支从头到尾是并排走的 —— 这是理解一切的前提。
压缩、去噪、坐标系 —— 一台视频模型的三块地基。
这一章全部有据可查:Seedance 1.0 是唯一公开了 Model Design 的一篇。
所有花哨结构的源头都是一个朴素的算术问题:像素空间太大了。先把这笔账算给你看。
图像模型只压空间,视频模型必须连时间一起压 —— 否则 121 帧就是 121 张图的成本。关键词是时间因果。
这一步是所有现代生成模型的共同心脏。理解它,才能理解第三章「同步为什么是免费的」。
Transformer 的注意力是「全员互看」,但 6 万个视觉 token 全员互看要炸。Seedance 的解法是拆成两种层,各管一件事。
注意力本身没有顺序概念 —— 打乱 token 它算出来一模一样。位置全靠位置编码「告诉」它。 这一页是第三章的钥匙:同步问题,本质是位置编码问题。
这是整个第一章里对日常工艺影响最大的一条,却几乎没人讲。
声音在这台机器里,被当成了「一张很窄很长的图」。
本章数字全部来自 Ovi(同构开源),字节未公开对应参数。
波形每秒几万个采样点,直接扔给 Transformer 同样是灾难。解法和视频一模一样:压。
这是全场最容易被误解的地方。答案朴素得让人失望,但正因为朴素,它的失效边界也就清清楚楚。
既然模型只认训练集的方言(第 10 页),那把训练标注的结构看一眼,就等于拿到了 prompt 模板。
官方原话:supports simultaneous multi-track output of audio content including background audio, ambient sound effects, and character narration。 这句话是真的 —— 但要看清它说的是什么。
整个 deck 的心脏。三根钉子,一个反直觉的结论:
没有人教它对齐 —— 对齐是自己长出来的。
要理解 Seedance 的做法有多「懒」,得先看看它的对立面有多费劲。
第 9 页埋的雷在这里引爆:两个模态 token 密度差 5 倍。如果各数各的,模型眼里的「同时」就是错的。
有了同一条时间轴,还得有同一个「完成度」。这就是第 7 页那个 t 的第二次登场。
同一条时间轴、同一个步调,还差最后一件事:让它们真的能看见对方 —— 而且要看得够频繁。
三根钉子钉完,你可能以为最后还有一个「同步损失」来收口。没有。Ovi 说得很直白 —— 同步涌现自「配对采样 + 共享 timestep」,全程没有显式 sync loss。
2.0 报告里那 17 类音频评测,是字节自己打的分(1–5 分,专家评)。既然是自己打的,那些低分就格外可信 —— 挑几行看。
| 类别 | 音质 | 音画同步 | 指令遵循 | 读法 |
|---|---|---|---|---|
| 英语 | 4.17 | 4.17 | 4.25 | 全表天花板 |
| 唱歌 / 说唱 | 3.71 | 4.14 | 3.71 | 相对 1.5 涨最多 |
| 中文多人对话 | 3.71 | 3.86 | 3.29 | 1.5→2.0 同步 2.36→3.86 |
| 环境 / 背景声 | 3.78 | 3.56 | 3.89 | 直出环境床可用 |
| 画外音 | 3.29 | 2.86 | 3.14 | 同步 2.86=全表最低 且是 17 类里唯一没超过 1.5 的 |
| 中文方言 / 口音 | 2.82 | 3.64 | 2.91 | 音质与指令遵循全表最低 |
| 中文戏曲 | 3.75 | 3.63 | 3.50 | 1.5 时指令遵循仅 1.75 |
前三章是「机器怎么想」。这一章回答:
既然它这么想,导演就该这么给。
我们那些工艺规矩,全都能在前面找到出处。
这是我们现在做分镜总板的主力工艺。它不是撞出来的偏方 —— 它写在架构里。
我们有一条铁律:ref 越明确越详细越好,宁多挂锚不让模型猜。这一页给它一个机制上的解释。
这四条是我们踩出来的规矩。学完前面三章你会发现:它们其实是架构的必然推论,早就写在论文里了。
四章,四句话。
所有的工艺 —— 焊死的 ref、写死的分镜格、按字速核过的台词、
抽轨自配的五轨声音 —— 都是同一件事的不同说法:
把那个分布,压窄到只剩你要的答案。