AI動画のカット割りとは、1本の動画を複数のショットに分け、ショットごとに秒数・カメラワーク・セリフを決めてから生成することです。動画生成AIは1回の生成で作れる長さに上限があるため、場面が切り替わる動画は、先に「シーン表」を作り、1シーンずつ生成してつなぐのが基本になります。
ところが、1つのプロンプトに「歩いてきて、笑顔で話して、最後に商品のアップ」と全部書くと、動きが混ざったり、途中で場面が変わらなかったりします。書き方の問題ではなく、1回の生成が基本的に1ショットを作る仕組みだからです。
この記事では、シーン表に書く項目と、シーン表から1シーンずつ生成してつなぐ手順を整理します。手順の実演には、当サイトの動画シナリオ作成ツールを使い、実際に出力されたプロンプト・字幕・BGMの指示をそのまま載せています。記載の内容は2026年9月28日時点の情報です。
結論|AI動画は1回の生成で1ショット。カット割りはシーン表を先に作る
主要な動画生成AIは、1回の生成で作れる長さが数秒〜数十秒に決まっています。公式ドキュメントで確認できる上限は次のとおりです。
| モデル(提供元) | 1回の生成で作れる長さ | 続きを足す機能(延長) |
|---|---|---|
| Sora 2(OpenAI API) | 最大20秒 | 1回で最大20秒、6回まで・合計最大120秒 |
| Veo 3.1(Gemini API) | 4秒・6秒・8秒から選ぶ | 1回7秒、20回まで |
| Seedance 2.5(ByteDance) | 最大30秒 | 延長して数分の動画にもできる |
出典はOpenAIのVideo generationガイド、Gemini APIのVeo 3.1ドキュメント(2026年9月17日更新)、Seedance 2.5はSeedance 2.5の提供経路の比較でまとめた公式ブログの数値です。同じモデルでも、使うサービスやプランによって上限は変わります。
30秒の動画に3〜5回の場面転換があるなら、1回の生成ではなく、シーンの数だけ生成してつなぐ前提で設計するのが確実です。そのための設計図がシーン表です。シーン表は、絵の代わりに文字で書く絵コンテだと考えると分かりやすくなります。
1ショットの中でのプロンプトの書き方(被写体・動き・カメラをどう書くか)は、AI動画生成の指示の出し方をDomoAIで6本検証した記事で実際に比べています。この記事では、その1ショットをどう並べるかを扱います。
シーン表に書く項目|秒数・ショット・カメラワーク・セリフ
シーン表には、1シーンにつき次の項目を書きます。動画シナリオ作成ツールの入力欄も、この順に並んでいます。
| 項目 | 決めること | 書き方の例 |
|---|---|---|
| 長さ(秒) | そのシーンが画面に映る時間 | 3秒 |
| 映像の説明 | 被写体・動き・場所 | 朝の静かな通りを、人がカメラに向かって歩いてくる |
| ショット | 被写体をどのくらいの大きさで映すか | ロング/バストアップ/アップ |
| アングル | カメラの高さと向き | 目線の高さ/見下ろし/見上げ |
| カメラワーク | カメラの動き | 固定/寄っていく/左右に振る |
| 光 | 時間帯や照明 | 自然光/夕暮れ/スタジオ |
| 話す人とセリフ | 誰が何を話すか | 話し手A「こんにちは。今日はこれを紹介します。」 |
| 次への切替 | 次のシーンへのつなぎ方 | カット/フェード/ディゾルブ |
| 効果音 | 必要なら音の指定 | ドアが閉まる音 |
ショット・アングル・カメラワーク・光は、ツールでは選択肢から選びます。選んだ項目は英語に変換されて出力されます。たとえば「ロング+寄っていく」を選ぶと wide shot, slow dolly-in、「アップ+見下ろし」は close-up, high angle になりました。動画生成AIが解釈しやすい定番の表現に揃うので、撮影用語を英語で覚えていなくても指定できます。
1シーンの動きは1つに絞る
1シーンに入れる動きは1つが原則です。「歩いて、振り返って、手を振る」のように動きを詰め込むと、どれかが省かれたり順番が崩れたりしやすくなります。動きが2つ以上あるなら、シーンを分けて、それぞれ短く生成したほうが狙いどおりになります。
秒数はセリフとサービスの上限から決める
秒数は、次の2つを満たす長さにします。
- セリフがあるシーンは、そのセリフを落ち着いて読み切れる長さにする(プレビュー再生で確かめる)
- 使う動画生成AIの1回の上限を超えない(超えるならシーンを分ける)
ツールは、10秒を超えるシーンがあると注意を表示します。Veo 3.1のように8秒までしか作れないモデルを使うなら、1シーンを8秒以内に収めておくと、そのまま1回の生成に対応させられます。
手順|シーン表から1シーンずつ生成してつなぐ
シーン表を作ってから完成までの流れは、次の7ステップです。
- 全体の設定を決める(画面比率・画風・色や雰囲気・セリフの言語)
- シーンを並べる(「+ シーン追加」で増やし、クリップの右端をドラッグして長さを整える)
- 各シーンの中身を入れる(映像の説明・ショット・カメラワーク・光・セリフ)
- セリフがあるなら「声」タブで話す人ごとに性別・年代・雰囲気を選ぶ
- プレビューを再生して、セリフが読み切れるか、切り替えが早すぎないかを確かめる
- 「シーン別」のプロンプトを1つずつ動画生成AIに貼って生成する
- 生成した動画を編集ソフトで並べ、字幕(SRT)とBGMを付ける
実例:3シーン・10秒の縦長ショート
ツールを開いたときに入っている例(商品紹介の縦長ショート)で、出力を確かめました。シーン表は次のとおりです。
| シーン | 時間 | ショット・カメラ | 光 | 内容 |
|---|---|---|---|---|
| 1 | 0:00〜0:03 | ロング・寄っていく | 自然光 | 朝の静かな通りを人が歩いてくる |
| 2 | 0:03〜0:07 | バストアップ・固定 | 指定なし | 笑顔で小物を持って話す「こんにちは。今日はこれを紹介します。」 |
| 3 | 0:07〜0:10 | アップ・見下ろし | スタジオ | テーブルに置いた小物のアップ。ナレーション「詳しくは概要欄へ」 |
このシーン表から、「シーン別」には次のプロンプトが出力されました(シーン2)。
Scene 2 of 3 (0:03–0:07, 4 seconds).
Format: 9:16 vertical.
Style: photorealistic live-action footage.
Camera: medium shot, static camera.
Action: The person smiles and talks to the camera, holding a small item.
話し手A (a bright, cheerful, young adult female voice) says in Japanese: "こんにちは。今日はこれを紹介します。"
No subtitles, captions, or on-screen text.画面比率と画風が、どのシーンのプロンプトにも毎回入っている点がポイントです。1シーンずつ別々に生成しても、比率と画風の指定が揃います。
一方で、話す人の名前「話し手A」は日本語のまま出力されています。話す人の欄は自由記述で、入力した文字がそのままプロンプトに入るためです。英語のプロンプトに揃えたいなら、話す人の欄を「Host」のように英語で書いておきます。映像の説明も同じで、英語で書いたほうがプロンプト全体が英語で揃います。
「シーン別」と「一括」の使い分け
プロンプトの出力には「シーン別」と「一括」の2形式があります。
| 形式 | 中身 | 向いている使い方 |
|---|---|---|
| シーン別 | 1シーン=1プロンプト。共通設定を毎回含む | 1シーンずつ生成して、編集ソフトでつなぐ(この記事の基本の手順) |
| 一括 | 全シーンを [0:00–0:03] のような時間つきで1つにまとめる | 1回で長めに生成でき、時間の指定を受け付けるサービスに貼る |
同じ例の「一括」は次のように出力されました。
A 10-second video, 9:16 vertical.
Style: photorealistic live-action footage.
Keep the characters, setting, and visual style consistent across all shots.
[0:00–0:03] Shot 1: Wide shot, slow dolly-in. Lighting: natural daylight. A person walks toward the camera on a quiet street in the morning.
[0:03–0:07] Shot 2: Medium shot, static camera. The person smiles and talks to the camera, holding a small item. 話し手A (a bright, cheerful, young adult female voice) says in Japanese: "こんにちは。今日はこれを紹介します。"
[0:07–0:10] Shot 3: Close-up, high angle. Lighting: soft studio lighting. Close-up of the item placed on a table. A narrator (a calm, adult male voice) says in Japanese: "詳しくは概要欄へ"
Background music: uplifting, acoustic guitar, around 100 BPM, instrumental.
No subtitles, captions, or on-screen text.「一括」は、1回で10秒以上を作れるモデル(Sora 2やSeedance 2.5など)で、短い動画を1回で試したいときに使えます。ただし、時間で区切って指示しても、はっきりしたカットの切り替えになるとは限りません。場面をきっちり切り替えたい動画は「シーン別」で1本ずつ作るほうが確実です。
シーンをまたいで人物や画風を揃えるには
1シーンずつ生成すると、シーンごとに人物の顔や服、背景の雰囲気が変わってしまうことがあります。揃えるための手段は、プロンプトの指定と、各サービスの機能の2段構えです。
| 手段 | やること | 補足 |
|---|---|---|
| 共通設定を毎回入れる | 画面比率・画風・色の指定を全シーンで同じにする | ツールの「シーン別」は自動で毎回入る |
| 一貫性の指示を入れる | 「全ショットで人物・場所・画風を揃える」と書く | 「一括」には自動で入る。指示であって保証ではない |
| 同じ参照画像を添付する | 人物や商品の画像を、各シーンの生成に毎回添付する | Veo 3.1は参照画像を最大3枚まで使える |
| 延長機能で続きを作る | 前のシーンの動画を元に、続きを生成する | OpenAIは動き・カメラの向き・場面のつながりを保ちたいときに延長を使うよう案内している |
参照画像と延長の仕様は、Gemini APIのVeo 3.1ドキュメントとOpenAIのVideo generationガイドによります。なお、OpenAIのAPIは、人の顔が写った画像を参照画像として受け付けていません(2026年9月28日時点)。人物を揃えたい場合は、使うサービスが人物の参照画像を受け付けるかを先に確かめてください。
ツールでシーンに画像を指定すると、そのシーンのプロンプトに「添付した参照画像を使う」という一文が入ります。画像そのものはプロンプトに含まれないので、生成するときに同じ画像を添付します。
字幕(SRT)とBGMの付け方
字幕とBGMは、動画を生成したあとで付けるのがおすすめです。理由は2つあります。
- 動画生成AIは、画面に文字を正確に出すのが得意ではない。字幕は動画の外で付けたほうが確実
- シーンごとに生成した音楽はつなぎ目で途切れる。BGMは全体に1本通したほうが自然
文字の出方は、DomoAIで6本検証した記事でもロゴの綴りは通ったものの毎回は保証されない結果でした。そのため、ツールの「画面に文字を出さない指示を入れる」をオンにすると、各シーンのプロンプトの末尾に No subtitles, captions, or on-screen text. が入ります。「シーン別」のプロンプトにはBGMの指示も入りません。
字幕:SRTを書き出して読み込む
「字幕 SRT」を開くと、セリフのあるシーンだけが、開始・終了の時刻つきの字幕ファイルの形で出力されます。同じ例では次のとおりです。
1
00:00:03,000 --> 00:00:07,000
こんにちは。今日はこれを紹介します。
2
00:00:07,000 --> 00:00:10,000
詳しくは概要欄へ「.srtで保存」でファイルにでき、YouTubeの字幕アップロードや、SRTの読み込みに対応した動画編集ソフトでそのまま使えます。YouTubeは、スタイル情報のない基本形式のSRT(UTF-8)に対応しています(YouTubeヘルプ:サポートされる字幕ファイル)。
BGM:カットの位置を渡して音楽生成AIで作る
「BGM」を開くと、音楽生成AIに貼るための指示が出力されます。ジャンル・雰囲気・テンポに加えて、動画の長さとカットの位置が入るのが特徴です。
Genre: acoustic guitar.
Mood: uplifting.
Tempo: around 100 BPM.
Length: about 10 seconds, written as background music for a video.
The video cuts at 0:03, 0:07; place gentle accents or changes near these points.
Instrumental only, no vocals.カットの位置(0:03と0:07)で音にアクセントを入れるよう指示しているので、映像の切り替えと音の変化が合いやすくなります。ツールのBGMタブに手持ちの音源ファイルを読み込むと、プレビュー再生で映像と一緒に流して確かめられます(音源はプロンプトには含まれません)。
よくある質問
Q. カット割りと絵コンテの違いは何ですか?
カット割りは動画をどのショットに分けるかという設計で、絵コンテはそれを1ショットずつ絵で描いた設計図です。AI動画では、絵の代わりに秒数・カメラワーク・セリフを文字で並べたシーン表が絵コンテの役割を果たします。
Q. シーン1つは何秒にすればいいですか?
セリフを落ち着いて読み切れる長さで、かつ使う動画生成AIの1回の上限を超えない長さにします。Veo 3.1は4秒・6秒・8秒から選ぶ仕様なので、Veoで作るなら8秒以内に収めると1シーン=1回の生成に対応させられます。
Q. 複数のカットを1回の生成で作ることはできますか?
時間を区切って「前半は〇〇、後半は△△」と指示することはできますが、はっきりしたカットの切り替えになるとは限りません。場面をきっちり切り替えたい動画は、シーンごとに1本ずつ生成して編集ソフトでつなぐほうが確実です。
Q. 動画シナリオ作成ツールはどの動画生成AIで使えますか?
特定のサービスの記法に依存しない汎用の英語プロンプトを出力するので、SoraやVeoなど、テキストで指示を受け付ける動画生成AIであれば使えます。1本ずつ生成するなら「シーン別」、1回で長めに生成できるサービスなら「一括」を使います。
Q. 映像の説明は日本語で書いてもいいですか?
書けますが、映像の説明や話す人の名前などの自由記述は入力した言語のまま出力されます。ショットやカメラワークなどの選択肢は英語に変換されるので、映像の説明も英語で書くとプロンプト全体が英語で揃います。セリフは話してほしい言語のまま書いてください。
Q. 入力した内容や画像はサーバーに送信されますか?
送信されません。入力内容・画像・音源はブラウザの中(IndexedDB)に自動保存されます。別の端末に移すときは「保存」タブからJSONで書き出せますが、JSONには画像と音源は含まれません。
まとめ
AI動画のカット割りは、1回の生成=1ショットという前提で、先にシーン表を作るのが近道です。要点は次の3つです。
- 1シーンに入れる動きは1つ。秒数はセリフの長さと使うAIの上限で決める
- 1シーンずつ生成して編集ソフトでつなぐ。画面比率と画風は全シーンで同じ指定にする
- 字幕はSRT、BGMは全体に1本。どちらも生成後に付ける
まずは3〜5シーンのシーン表を作り、1シーン目のプロンプトを手持ちの動画生成AIに貼って1本生成してみてください。ツールの画面の見方と出力形式の詳細は動画シナリオ作成ツールの使い方にまとめています。
