Top.Mail.Ru
MP3 转视频:音频转视频,AI 按结构生成 MV

把一个 MP3 变成一支 MV

歌你已经有了:自己录的、棚里出的母版,或者从旧硬盘里翻出来的一个文件。传上来,ClipChat 就会把音频读一遍——曲风、BPM、调性、演唱语言、主奏乐器、情绪,以及每个段落从哪开始、到哪结束。在渲染任何东西之前,你先拿到一份文字版的歌曲解读和一套带时间码的分镜。

上传音频文件 → 读出歌曲结构 → 带时间码的分镜 → 渲染场景
上传你的 MP3
免费且不用注册:文字解读、最多 2 个视觉世界、最多 6 张带时间码的场景卡,约 60 秒出结果。第一步给的是文字和分镜,不是视频。出视频需要注册。
Pipeline

怎么运作

从一个音频文件到渲染好的场景。任何东西生成之前,整套计划你都先看得到。

01
上传音频文件
MP3、WAV、M4A、AAC 或 OGG,最长 10 分钟。必须是文件——ClipChat 不收流媒体页面的链接。
02
先分析这首歌
曲风、BPM、调性、演唱语言、主奏乐器和情绪。ClipChat 还会标出各段落之间的边界。
03
拿到解读和场景卡
一份文字版的解读,说明这首歌在讲什么,加上最多 2 个视觉世界和最多 6 张带时间码的场景卡。约 60 秒,不用注册。
04
在对话里聊
这一步需要账号。像跟导演说话那样聊这份解读:换世界、换人物、改某一段的调子。
05
确认整片分镜
整支片子先在纸面上排好,渲染开始之前给你过目。计划你不认,就不会拿去渲染。
06
生成场景
切点落在歌曲结构上——主歌、副歌、bridge、drop——而不是均匀的节拍网格。长曲子按段落分批处理。
Difference

ClipChat 和自己动手剪的对比

手动剪映 / DaVinci ResolveClipChat
输出分辨率最高 1080p 或 4K,只受你手上素材的限制。目前 480p,竖屏 9:16。这个更低。如果分辨率是你的第一要求,那还是手动剪。
画面从哪来全靠你自己供:素材库、自己拍的镜头,或者带团队拍一天。场景是按确认过的分镜生成的,所以你不需要拥有或拍摄任何素材。
让切点对上歌你自己从头听一遍,手动标出段落变化。一首歌通常要耗掉好几个小时。段落边界是从音频里读出来的,切点自动落在上面。
同一个人物贯穿全片除非你拍的就是同一个人。不然要么补拍,要么忍。一张参考图就够让人物在每个场景里保持一致。给五个角度会更稳。
对剪辑的控制完全掌控。时间线摆在眼前,每一帧都能挪。你在渲染前确认解读和整片分镜,但不会在逐帧时间线上干活。
FAQ

大家常问的

怎么把 MP3 转成 MV?

把 MP3 传给 ClipChat。它会分析这首歌——曲风、BPM、调性、演唱语言、主奏乐器、情绪——并标出每个段落从哪开始、到哪结束。然后你拿到文字解读和带时间码的场景卡。这份计划可以在对话里讨论和修改,确认分镜之后,场景就开始生成。ClipChat 是给你已经有的歌做视频,它不生成音乐。

不注册能免费用音频做视频吗?

不注册能拿到文字解读、最多 2 个视觉世界和最多 6 张带时间码的场景卡,约 60 秒出结果。这个结果是文字和分镜,不是视频文件。要渲染视频得有账号,注册会送一份起步额度,够做第一支短片。

能传哪些音频格式,歌最长多久?

MP3、WAV、M4A、AAC 和 OGG,最长 10 分钟。传的是文件本身,不是链接。太长的曲子会按段落分批处理,而不是一次跑完。

成片是什么分辨率和画幅?

目前渲染是 480p,竖屏 9:16。这是当下老实的上限。如果你要 1080p 母版或者横屏版本,ClipChat 现在还接不了这活。

切点真的跟着我的歌走,还是随机的?

跟着结构走。ClipChat 会在音频里标出段落边界——主歌、副歌、bridge、drop——把切点放在那儿,而不是按固定的节拍网格换画面。每个镜头的长度跟的是歌,不是秒表。

同一个人能出现在每个场景里吗?

可以。一张参考图就够让人物贯穿整支片子的所有场景。同一个人物再给五个角度,稳定性还会更好。

Honesty

ClipChat 不做的事

我们为什么这么做

大多数自动工具是按固定的节拍网格切视频。这个好实现,也正是很多 AI 片子看着都一个样的原因:不管歌变没变,画面每两小节换一次。歌不是这么工作的。主歌、副歌、bridge 和 drop,各自需要不同的镜头长度和不同的能量,而唯一尊重这一点的办法,是先在音频里找到段落边界。所以 ClipChat 先把歌读一遍,写下它认为这首歌在讲什么,再把带时间码的整片分镜摆给你看,然后才渲染第一个场景。解读错了,你在对话里改,一秒渲染时间都不浪费。480p 是目前输出的水平——我们决定先解决的,是把结构做对。

先上传,先读计划,再渲染

上传你的 MP3