Top.Mail.Ru
MP3から動画を作成:音声ファイルでAIミュージックビデオ

MP3からミュージックビデオを作る

曲はもう手元にあるはずです。自分の録音、スタジオのマスター、古いドライブに入っていたファイル。それをアップロードすると、ClipChatが音声を読み取ります。ジャンル、BPM、キー、歌の言語、主役の楽器、ムード、そして曲の各セクションがどこで始まりどこで終わるか。何かが生成される前に、曲の読み取りを書いた文章とタイムコードつきの絵コンテが届きます。

音声ファイルをアップロード → 曲の構成を読む → タイムコードつきの絵コンテ → シーンを生成
MP3をアップロード
無料・アカウント不要:文章の解釈、最大2つの世界観、タイムコードつきのシーンカード最大6枚が約60秒で届きます。この最初の結果は文章と絵コンテで、映像ではありません。映像の生成にはアカウントが必要です。
Pipeline

使い方

音声ファイルから生成済みのシーンまで。何かが生成される前に、全体のプランを見られます。

01
音声ファイルをアップロード
MP3、WAV、M4A、AAC、OGGを10分まで。ファイルである必要があります。配信ページへのリンクは受け付けません。
02
曲が解析される
ジャンル、BPM、キー、歌の言語、主役の楽器、ムード。あわせて曲のセクションの境目にも印がつきます。
03
解釈とシーンカードが届く
この曲が何についての曲かを書いた文章、最大2つの世界観、タイムコードつきのシーンカード最大6枚。約60秒、アカウント不要です。
04
チャットで話し合う
ここからはアカウントが必要です。監督と話すように解釈について話せます。世界観を変える、人物を変える、あるセクションのトーンを変える。
05
絵コンテ全体を承認する
クリップ全体が先に設計され、生成が始まる前にあなたに提示されます。納得できないプランのまま生成されることはありません。
06
シーンが生成される
カットはビートの等間隔グリッドではなく、曲の構成(Aメロ、サビ、ブリッジ、ドロップ)に置かれます。長い曲はセクションごとに処理されます。
Difference

ClipChatと、自分で編集する場合の比較

CapCut / DaVinci Resolve で手作業ClipChat
出力解像度1080pや4Kまで。素材の質だけが上限になります。現状は480p、縦型9:16。こちらのほうが低いです。解像度が最優先なら手作業で編集してください。
映像の出どころすべて自分で用意します。ストック素材、自分で撮った映像、あるいはスタッフを入れた撮影日。承認済みの絵コンテからシーンが生成されるので、素材を持っている必要も撮影する必要もありません。
カットを曲に合わせる通しで聴いて、セクションの変わり目を自分で打ちます。1曲でたいてい数時間の作業です。セクションの境目は音声から読み取られ、カットが自動でそこに置かれます。
同じ人物を通す同じ人を撮っていた場合のみ。そうでなければ撮り直すか、ずれを受け入れます。参照画像が1枚あれば、どのシーンでも同じ人物を保てます。5方向あればさらに安定します。
編集の自由度完全に自由です。タイムラインが目の前にあり、1フレーム単位で動かせます。生成前に解釈と絵コンテ全体を承認しますが、フレーム単位のタイムライン作業はしません。
FAQ

よく聞かれること

MP3からミュージックビデオを作るには?

MP3をClipChatにアップロードします。曲を解析し(ジャンル、BPM、キー、歌の言語、主役の楽器、ムード)、各セクションの始まりと終わりに印をつけます。そのうえで、文章の解釈とタイムコードつきのシーンカードが届きます。そのプランをチャットで話し合って直し、絵コンテを承認すると、シーンが生成されます。ClipChatはすでにお持ちの曲に映像をつけるもので、音楽そのものは作りません。

登録なしで、手持ちの音声から無料で映像を作れますか?

アカウントなしで得られるのは、文章の解釈、最大2つの世界観、タイムコードつきのシーンカード最大6枚で、所要はおよそ60秒です。この結果は文章と絵コンテであって、映像ファイルではありません。映像を生成するにはアカウントが必要で、最初の短いクリップ用の初期枠がつきます。

アップできる音声形式と曲の長さは?

MP3、WAV、M4A、AAC、OGGを10分まで。リンクではなくファイルそのものをアップロードします。長い曲は一度に通すのではなく、セクションごとに処理されます。

完成した映像の解像度と画面比は?

現状は480p、縦型9:16です。これが正直な今の上限です。1080pのマスターや横型が必要な場合、ClipChatはまだその用途に向きません。

カットは本当に曲に沿いますか。それともランダムですか?

構成に沿います。ClipChatは音声の中のセクションの境目(Aメロ、サビ、ブリッジ、ドロップ)に印をつけ、そこにカットを置きます。決まったビートのグリッドで絵を切り替えることはしません。ショットの長さはタイマーではなく曲に従います。

同じ人物をすべてのシーンに出せますか?

はい。参照画像が1枚あれば、クリップの全シーンで人物の見た目を保てます。同じ人物の5方向を足すと、さらに安定します。

Honesty

ClipChatがしないこと

なぜこの作りにしたか

自動系のツールの多くは、決まったビートのグリッドで映像を切ります。作りやすいからで、AIクリップがどれも似て見える理由もそこにあります。曲が変わろうが変わるまいが、2小節ごとに絵が替わるのです。曲はそんなふうにはできていません。Aメロ、サビ、ブリッジ、ドロップはそれぞれ違うショット長と違う熱量を必要とし、それを尊重する唯一の方法は、まず音声の中のセクションの境目を見つけることです。だからClipChatは曲を読み、この曲は何についての曲だと考えたかを書き出し、1シーンも生成しないうちにタイムコードつきの絵コンテ全体を見せます。読みが外れていればチャットで直せて、生成の時間は無駄になりません。480pというのが今の出力の現在地です。構成を正しく扱うことを、私たちは先に解くべき問題だと決めました。

曲をアップして、何かが生成される前にプランを読む

MP3をアップロード