「シネマティック」「史詩的」なプロンプトなしでニューラルネットワークを导演するためのガイド
ニューラルネットワークでビデオ生成を試みたことがある人は多いだろう。シンプルなプロンプトを書くと、ブレた混沌とした結果が返ってくる。「cinematic」「hyperrealistic」「8k」「dramatic lighting」などの単語を追加すると、少しは見栄えが良くなるかもしれないが、キャラクターの動きは相変わらず chaos で、カメラは適切なタイミングで晃动し、ストーリーの2番目のショットは1番目ともはや似ても似つかないものになる。
リポジトリの作成者 seedance-2.0 は、根本的に異なるアプローチでこの問題に取り組んだ。LLMエージェント向けのスキルセット「Seedance 2.0 Skill OS」は、ビデオモデルとの連携の基本原則を変更する。プロンプトに意味のない修飾子を詰め込む代わりに、このプロジェクトはニューラルネットワークに映画制作の思考——フレーミング、ライティング、mise-en-scène、編集ペース——をさせる。
従来のプロンプトアプローチが失敗する理由
ほとんどのビデオジェネレーターは、何百万もの画像とビデオクリップで訓練されている。プロンプトに「cinematic」と書いても、モデルはあなたがどの具体的な映画を指しているのか——1930年代のノワール、Michael Bayのアクション映画、内面的なドラマ——を理解しない。単に全体的な平均的温度を混合するだけだ:暗い影、ある程度のコントラスト、背景のボケ。
セット上のカメラマンはそんな働き方はしない。特定のレンズを選び、窓からの柔らかな光をセットし、俳優に手紙を読んだ後2秒間静止するよう指示する。
リポジトリ seedance-2.0 は、AIアシスタントをまさにそのような監督に変える。このプロジェクトには、Claude Code、Codex、Cursor、OpenClaw などのクライアント向けの指示セット(スキル)と参照資料が含まれている。エージェントに生成用のプロンプトを組み立てるよう依頼すると、意味のない単語の羅列ではなく、まずシーンのドラマ的意図を把握する。
2つのアプローチを比較してみよう。典型的なユーザーの記述:
epic cinematic shot of a woman reading a letter, emotional, beautiful lighting
リポジトリの导演エンジンが同じシーンを構成する方法:
A woman at a kitchen table reads the letter twice, then her hands lower it and go still.
Camera: medium close-up at eye level, a slow push-in that settles when her hands stop.
Soft window light keeps her face plain.
Sound: room tone, one chair scrape, near-silence — the realization lands in the stilled hands, not a word.
2番目のオプションはモデルの動作を厳密に制約する:まずオブジェクトとアクション、それからカメラの動き、そして照明の特性とサウンドデザイン。ニューラルネットワークは「美しい絵」への曖昧なヒントではなく、明確なアクションアルゴリズムを受け取る。
参照の分離とキャラクターの固定
1つのテイクを超えるビデオ作成における主な問題の1つは、キャラクターの外見とスタイルの維持だ。単に3つの参照をモデルにアップロードして「似せて作って」と頼むと、ニューラルネットワークは1人の顔、別のビデオの動き、3番目のガンマ値を混合してしまう。
Seedance 2.0 Skill OS seedance-2.0 では、各入力ファイルに明確な役割がタグ付けられる:
- 顔やオブジェクトの画像はアイデンティティタグ
@Image1でタグ付け - ダイナミクスやカメラの動きを含むビデオはモーションテンプレート
@Video1としてタグ付け - オーディオトラックはリズムと動きのフェーズ
@Audio1に関連付け
サイトまたはローカルエージェントがこれらのタグをモデルにそのまま渡されるようにする。単一シーンの最初と最後のフレームを接続する必要がある場合(First/Last Frame モード)、エンジンはエンドポイントを固定して連続的なトランジションを構築する。
1回の生成より長いビデオを作成する方法
よくある間違いは、ストーリーを単に元のプロンプトに追加するだけで続けようとすることだ。ニューラルネットワークはほとんどビデオを正確にあなたが意図した場所で終了しない。キャラクターが少しだけ頭を回したり、横に一歩踏み出したりしているかもしれない。次のショットを「ゼロから」生成すると、シーケンスは崩壊する。
リポジトリにはシーン継続プロトコル(seedance-continuation)がある:
- 全体的なコンセプトとスクリプトの最終点を記述する。
- システムがストーリーを短い接続されたセグメントに分割する。
- 最初のクリップが生成される。
- 結果の出力またはその最後のフレームをシステムに返す。
- エージェントは実際の結果状態(キャラクターがどこで終わったか、光がどこを指しているか)を記録する。
- その後にのみ、2番目のクリップのプロンプトが構築される。
このアプローチはエラーの蓄積から保護する。3回目のテイクでキャラクターが予期せず服を変更したり、異なる部屋にいたりすることを防ぐ。

著作権保護とフィルターでの作業
ニューラルネットワークに有名な映画キャラクターやブランドを生成するよう依頼すると、プラットフォームのセーフティフィルターがトリガーされ、拒否される。リポジトリには特別なモジュール seedance-copyright がある。保護された知的財産を含むリクエストを取得し、雰囲気を維持しながら安全な視覚的同等物に書き換える。
stop words の誤検知も同様に処理される。フィルターを覆い隠す jargon で騙そうとするのではなく、モジュール seedance-filter は撮影コンテキストを洗練させる。例えば、ドラマチックな落下シーンは、プロフェッショナルなスタuntsワークの用語とカメラアングルを介して記述され、プラットフォームのセーフティシステムから疑念を取り除く。
アーキテクチャとインストール
構造上、リポジトリはネイティブ Agent Skills パッケージだ。中にはルートファイル SKILL.md、カテゴリー別(カメラ、ライティング、キャラクター、VFX、オーディオ処理)に整理されたサブスキルセット、references/ フォルダ references/ 内の大規模な参照ライブラリが含まれている。
インストールは、CLIクライアントまたはIDEの適切なディレクトリにスキルをコピーする単一のスクリプトを実行するだけだ:
git clone https://github.com/Emily2040/seedance-2.0.git
cd seedance-2.0
# Автоматическая установка для Codex или других клиентов
python scripts/install_codex_skill.py
# Установка для Claude Code
python scripts/install_codex_skill.py --dest ~/.claude/skills
リポジトリには検証とテストスクリプトが含まれている。新しいルール released 前には、作成者はオフラインスキーマチェッカーを実行し、ソースの鮮度を検証し、プロンプトのレジリエンスに対するストレステストを行う。
多言語プロジェクト向けには、データベースには英語、中国語、日本語、韓国語、スペイン語、ロシア語でのプロフェッショナルな映画用語集が含まれている。これは、サブタイトルのローカライズされたテキストを正確に翻訳したり、「panning」などの特定の用語の意味を失わずに伝えたりする必要がある場合に役立つ。
このリポジトリの対象ユーザー
このプロジェクトは主として、ByteDance ビデオモデル(Seedance 2.0、Dreamina、Jimeng、Volcengine Ark)および Runway や OpenRouter などの関連サービスを使用するビデオメーカー、マーケティングチーム、開発者を対象として作成された。
たまに面白いGIFを生成したいだけなら、システムは大げさに感じるかもしれない。しかし、10シーンの首尾一貫したコマーシャルの作成、ブランドの統一されたビジュアルスタイルの確立、LLMエージェントを通じた生成パイプラインの自動化などのタスクがある場合、Seedance 2.0 Skill OS seedance-2.0 は失敗した生成に多くの時間と予算を節約できる。
関連プロジェクト