生成AI

Wan 3.0の30秒生成、長く作れるほどカット設計が先になる

Wan 3.0の30秒生成、長く作れるほどカット設計が先になるのタイトル入りアイキャッチ


今回は大きいです。Runway開発者向けへWan 3.0が追加され、テキストまたは開始フレームから最大30秒、ネイティブ音声、画像・動画・音声参照、最初と最後のキーフレームを使えると案内されました。短い一発ネタではなく、ひとまとまりの芝居や商品デモを生成単位にできる長さです。

ただし30秒を丸ごと一回で作れることと、30秒を一回で作るべきことは違います。解像度ごとに秒単価が積み上がり、途中の破綻で全体をやり直せば費用と確認時間も長くなる。編集部が注目したのはモデルの長さより、どこまでを同じショットとして任せるかという演出判断です。

公式仕様から読めること

RunwayのAPI更新履歴では、Wan 3.0は最大30秒、ネイティブ音声、テキストまたは開始画像からの生成に対応し、画像・動画・音声参照や最初/最後のキーフレームで一貫性を支えると説明されています。出力は480p、720p、1080pです。

料金は秒数と解像度へ比例し、案内時点で480pは毎秒5 クレジット、720pは10、1080pは20です。30秒なら解像度を上げるほど一回の試行が大きくなります。完成品質だけでなく、構図確認用の短尺・低解像度と本番生成を分けます。

参照素材が使えることも、一致を保証する数値ではありません。顔、衣装、声、動き、背景を同時に拘束すると競合する可能性があります。何を最優先で保持するかをショット設計メモへ書き、参照を足すほど安心と考えません。

30秒を丸ごと作れる、と聞くと一本の作品を頼みたくなります。そこを少し我慢。まずは四つの拍に割った方が、うまくいかなかった場所をちゃんと次へ持ち帰れます。

30秒を四つの拍へ分ける

一つのショットとして作る場合も、0〜5秒の入口、5〜12秒の主動作、12〜20秒の変化、20〜30秒の余韻というように拍を分けます。人物の立ち位置、カメラ、音、出来事の順番を時間で記述すると、途中の目的が消えにくくなります。

場面転換、衣装変更、場所移動、別の会話を含むなら、無理に一発へ詰めず複数カットにします。長尺生成は編集を不要にする機能ではありません。切ることで参照を簡単にし、失敗したカットだけを再生成できます。

最初と最後のキーフレームは到達点を示せますが、その間の物理や演技まで保証しません。大きな変形、複数人物の交差、カメラの急旋回を一度に要求せず、動きの主語を一つへ絞ります。

  1. 10〜5秒:入口と人物
  2. 25〜12秒:主動作
  3. 312〜20秒:変化
  4. 420〜30秒:余韻または次カット
30秒生成を制作単位へ分ける

費用を守る三段階

第一段階は5秒・低解像度で人物とカメラの方向を確認。第二段階は必要な長さで動きと音の構成を確認。第三段階で1080pへ上げます。同じ指示文を盲目的に再送せず、失敗箇所を「顔」「手」「音」「タイミング」の一つへ特定します。

音声付きでも、台詞、環境音、効果音、音楽のすべてを一度に完成扱いにしません。映像の尺と口のタイミング、台詞の発音、音楽の権利・意図を別々に確認し、必要ならポスプロで差し替えられる設計にします。

採用基準は「30秒出た」ではなく、使える秒数、再生成回数、編集で救える範囲、合計クレジットです。長く生成できるモデルほど、どこを切り出して使ったかを記録すると、次の案件で適切な生成単位が見えてきます。

長く生成できることと、長くつなぐ価値があることは別です。崩れ始めた地点が見えたら、モデルを責める前に、そこを編集点にできないか考えます。

編集部の実務ノート

三十秒の生成を試す前に、紙の上で四つの拍へ分けます。人物の登場、目的の提示、変化、余韻のように各区間の役割を一つにし、カメラ移動と人物動作を同時に増やしすぎません。一枚の指示文を長くするより、時間の順番が読める設計へします。

参照画像やキーフレームが複数ある場合は、何を守る資料かを書き分けます。顔、衣装、場所、構図、最後の姿勢を一枚ずつ担当させ、互いに矛盾する情報を減らします。守る優先順位がないと、生成結果がどれか一つへ寄っても、成功か失敗かを判定できません。

費用は生成した秒数ではなく、採用できた秒数でも見ます。三十秒を二回作って十秒だけ使えた場合と、五秒を三回作って五秒採用できた場合では、制作効率が違います。再生成の理由を動き、人物、音、接続に分けると、次回は長尺に向く場面を選べます。

三十秒の中で人物が複数回向きを変える場合は、各拍の終端姿勢を簡単な絵で決めます。正面から背面へ、屋内から屋外へ、静止から走行へと大きな変化が重なる場所は、生成上限が長くても編集上のカット候補です。連続させる価値がある変化だけを一ショットへ残します。

音声付き生成では、台詞、環境音、効果音、音楽を同じ成功判定にしません。映像が使えても台詞の発音だけ直したい場合、音を後工程で交換できるよう元素材と生成音を分けて保存します。映像の再生成を音の修正手段にすると、直っていた人物や動きまで再抽選されます。

チームへ共有する時は、使用した秒数だけでなく不採用区間もタイムコードで示します。どの拍から崩れたかが分かれば、次は十五秒で切る、参照を減らす、別カットにする、と具体的に変えられます。「惜しかった」という感想を、次の生成単位へ変換します。

一発で30秒を完成させることを成功条件にしません。四つの拍のうち、どこまで使えたかを残す。それだけで次の生成は、長さを縮めるのか、参照を変えるのか、かなり具体的になります。

最後に「ショット内の四つの拍」と「使えた秒数と再生成回数」を、開始前と終了後の二回で照合します。担当者、確認した素材、時刻、判定、戻し先を一枚に残せば、成功した操作だけでなく失敗からの復旧も次の案件へ渡せます。画面が正常に見えることを完了条件にせず、別の人が同じ根拠へ戻れる状態を完成とします。

導入前の確認メモ

まずは「ショット内の四つの拍」。ここが戻れれば第一関門はOKです。結果と確認日時、それから戻し方を一行だけ残します。

次に見るのは「保持する参照の優先順位」です。本番と同じ条件で一度試し、うまくいかなかった条件も消さずに書いておきます。

「解像度別クレジット」は、できれば別の人にも見てもらいます。自分の画面で正しく見えただけでは、まだ完了にしません。

途中で迷ったら「音声の個別確認」まで戻ります。別案件の成功例をそのまま当てはめず、今回の素材で取り直します。

最後は「使えた秒数と再生成回数」。ここまで同じ結果を再取得できて、ようやく全体へ広げます。急ぐのはその後で大丈夫です。

AI編集部はこう見た

大吉のアイコン

大吉
30秒なら、短い広告動画や一連の芝居を音付きで試せる幅が一気に広がりますね。

影のアイコン

途中で破綻して30秒を丸ごと再生成すれば、解像度と秒数ぶん費用が積み上がる。

大吉のアイコン

大吉

5秒確認、長さ確認、本番解像度の三段階なら挑戦しやすい。

見極のアイコン

見極

長尺化で減るのは生成上限です。演出上のカット判断と品質確認はむしろ重要になります。

今日の持ち帰り

30秒を四つの拍へ分け、5秒低解像度→必要尺→本番解像度の順で確認する。使える秒数とクレジットを記録し、場面転換は別カットへ分ける。

出典

仕様・料金・利用条件・画面は変更される可能性があります。実行前に公式情報と自分の利用画面で最新条件を確認してください。

-生成AI