top of page

KNOWLEDGE

Grok動画化を高く評価しても、静止画の不一致は残った――ChatGPT→Grok制作で前工程を切り分けた実例

​著者:可児波起

​確認日:

2026年9月25日

​更新日:

2026年9月29日

ANSWER

​【結論】

複数AIをつなぐ制作では、下流工程が良くても上流の不一致は別に確認します。『最後の焼きそばパン』ではGrokの動画化を本人が高評価した一方、ChatGPT側の静止画では人物・店・小物の一貫性が崩れました。これはモデル優劣ではなく工程診断の記録です。

左側に人物・店舗・小物が揺れる複数のChatGPT静止画、中央に工程の切り分け、右側に可児 波起が高く評価したGrokの6秒動画化工程を置き、静止画側の不一致が残ったことを示した16:9編集図解

Explanation

【詳しく解説】

結論――モデル単体ではなく、制作パイプラインのどこが止めているかを見る

複数の生成AIを組み合わせる制作では、「どのモデルが一番高性能か」だけを見ても、作品全体の問題箇所は分かりません。各工程が別の役割を持ち、前工程の出力を次工程が受け取る場合、今回の制作では、下流の動画化を本人が高く評価しても、入力静止画の不一致は別問題として残りました。

『最後の焼きそばパン』では、ChatGPTが静止画、Grokが短い動画化を担当しました。可児 波起の実地確認では、動画化は高評価だった一方、動画化する前の静止画で人物・背景・小道具が揺れていました。このため、制作を前へ進めるうえでの制約は、少なくともこの時点では静止画側へ移りました。

最初の役割分担は、ChatGPTで静止画、Grokで6秒動画

この短編は、仕事帰りの中年男性が昔ながらのパン屋で最後の焼きそばパンを見つけ、小学生の女の子に譲る小さな人間ドラマです。可児 波起はGrokの使い方について「最初に画像を貼って、それに丁寧なプロンプトを入れるとうまくいく」と共有し、キーフレームを先に作ってから動画化する工程を採用しました。

工程は、ChatGPTで1カット目の静止画を作る、Grokへその画像と動画プロンプトを渡す、6秒の動画へ変換する、次の静止画へ進む、という形です。つまりGrokは、ゼロから作品世界を作る役割ではなく、前工程で確定した一枚を動かす役割として使われました。

Grok動画化は高評価だったが、静止画の時点で別人・別店舗になった

可児 波起は実際の動画化テスト後、「Grokの動画化はめちゃくちゃ凄い!! 全然破綻しない」と報告しました。一方、同じ制作でChatGPTが作った静止画については、「でも、画像生成がダメだった。同一人物を構図を変えて書けない」と評価しています。

さらに、男性の顔がカットごとに違う、女の子も別人に見える、パン屋の外観が変わる、焼きそばパンの見た目が変わる、街の背景がラーメン屋や定食屋になる、ショーケースの位置や中のパン数、男性の立ち位置が変わる、と具体的な問題が挙げられました。

制作会話の途中で、アシスタントが画像生成主体を曖昧に扱った際には、可児 波起が「画像生成はChatGPTだよ!」と訂正しています。この訂正により、静止画生成とGrok動画化を同じ失敗として扱わず、工程ごとに分けて評価するようになりました。

動画側だけを問題視できなかった――入力静止画の不一致が残っていた

この切り分けで重要なのは、最終的な映像に違和感があるからといって、動画生成工程だけを原因候補にしないことです。今回、可児 波起が高く評価したのは、与えた静止画を6秒動画へ変換するGrok側でした。

一方で、カット1とカット2の静止画が別人、別店舗、別のショーケースに見えるなら、各動画がそれぞれ滑らかに動いても、つないだ瞬間に作品世界は揺れます。下流の生成が前工程で失われた同一性を自動的に復元した、という確認はありません。

ボトルネックは「最も性能が低いAI」ではなく「全体を止める工程」

ここでいうボトルネックは、モデルランキングではありません。この制作の目的に対して、次工程へ渡す素材の品質を十分に保てず、全体の進行や完成度を制約した工程を指します。

可児 波起は当初、人物の年齢、体型、髪型、服、バッグ、ランドセル、パン屋、焼きそばパン、時間帯、光、カメラ、レンズなどの指定を増やしました。しかし本人は「指定しすぎると、そもそも画像が出てこなかった」とも報告しており、詳細指定を増やせば単純に解決する問題ではありませんでした。

その後、「ごまかさないと、まだ出来ない」「もっと構図を変えていいのよ」と判断し、背中、横顔、手元、反射、小物アップ、遠景などへ構図を変える方向へ進みました。つまり静止画側をボトルネック候補として重点的に見るようになった後、同じ方法で押し続けるのではなく、制作工程そのものを変更しています。

複数AIの役割分担では、各工程を別々に評価する

この実験から再利用できるのは、「ChatGPTは静止画に弱い」「Grokは動画に強い」という固定的なモデル評価ではありません。モデルや機能は変わり、今回の試行条件も限定されています。再利用できるのは、複数AIをつないだときに、各工程を別々の品質基準で評価し、最終成果物の違和感を上流へさかのぼって切り分ける方法です。

同じ役割分担の考え方は、Chatで考え、Workは確定操作だけにするでも、調査・判断と外部操作を別工程へ分けた実務例として扱っています。今回の短編映像では対象が創作ですが、「得意な工程へ役割を割り当て、工程ごとに問題を切り分ける」という点で比較できます。

前工程の問題は、カット間STATEの問題ともつながる

静止画が揺れた具体的な中身は、人物、場所、小道具、立ち位置など、前カットですでに確定したSTATEが次の生成へ維持されない問題でもあります。この観点は、「自然に書ける」と「状態を維持できる」は別だったで、小説と映像を横断して整理しています。

また、動画側の生成区間を短くした経緯は、10秒の後半が破綻しやすいと感じ、6秒へ分けたで、6秒化と同時に変更した条件も含めて記録しています。

確認できたことと、まだ確認できていないこと

確認できたこと:可児 波起がGrok動画化を「全然破綻しない」と評価したこと。同じ制作でChatGPT静止画の人物・背景・小道具の不一致を問題として指摘したこと。「画像生成はChatGPT」と主体を訂正したこと。その後、構図や制作工程を変更したこと。

確認できていないこと:Grok動画が客観的に無破綻だったこと、ChatGPT静止画だけが完成失敗の唯一原因だったこと、現在の各モデルでも同じ優劣になること、各工程の成功率、静止画の一貫性が改善すれば完成作品全体がどの程度改善するか。

実務との接続:静止画から動画へつなぐ工程を分けて管理する制作の実例は、海辺の部屋の動画制作ポートフォリオでも確認できます。

このKnowledgeの関連知識

動画工程の実験:10秒の後半が破綻しやすいと感じ、6秒へ分けた。Grok側を短い生成区間へ分けた経緯を見る。

状態維持の問題:「自然に書ける」と「状態を維持できる」は別だった。静止画側で失われた人物・場所・小道具をSTATEとして捉える。

別領域の役割分担:Chatで考え、Workは確定操作だけにする。AIごと・工程ごとに役割を分ける実務設計と比較する。

EVIDENCE

【根拠・検証】

Evidence

【直接確認できる事実|制作フロー】
短編『最後の焼きそばパン』で、ChatGPTによる静止画作成→Grokへの画像入力→6秒動画化→次カット、という工程を採用しました。

【本人の評価|Grok動画化】
テスト後、可児 波起は「Grokの動画化はめちゃくちゃ凄い!! 全然破綻しない」と報告しました。動画そのものをこのKnowledge制作時に再生して独立評価した結果ではありません。

【直接確認できる事実|ChatGPT静止画】
複数の生成画像で、男性・女の子・パン屋・焼きそばパン・ショーケース・周辺店舗・立ち位置などにカット間差異があり、可児 波起が具体的に指摘しました。

【本人の訂正】
画像生成主体を曖昧に扱ったアシスタントに対し、可児 波起は「画像生成はChatGPTだよ!」と訂正しました。以後、ChatGPT静止画生成とGrok動画化を別工程として評価しました。

【AIによる分析】
この制作では、動画生成より前の静止画一貫性が制作パイプライン上のボトルネックとして浮かんだ、と整理しました。これはモデル一般の性能順位ではなく、当該制作条件で全体進行を制約した工程についての分析です。

【未確認事項】
各工程の定量成功率、動画そのものの第三者評価、静止画改善による完成品質の改善率、現在のモデルでも同じ結果になるかは未確認です。

SOURCES

【情報源】

Sources

PRIMARY SOURCE|非公開一次記録
可児 波起とChatGPTによる短編『最後の焼きそばパン』制作の会話・修正記録、および会話内で比較した生成画像群。ChatGPT静止画→Grok動画化の役割分担、Grok動画に対する本人評価、静止画の人物・背景・小道具差異、制作方法の変更を確認しています。

確認範囲
このKnowledgeではGrokやChatGPTの公式性能資料を使ったモデル比較は行っていません。「Grok動画化は高評価」「ChatGPT静止画がボトルネックとして浮かんだ」は、この制作実験と可児 波起の実地評価に限定した記述です。

Author

【著者】

可児波起

​マーケティングデザイナー / DXコンサルタント / 音楽家

次に読む

動画側の設計を見る

10秒の後半が破綻しやすいと感じ、6秒へ分けた――AI短編動画を短い区間でつないだ実験

下流の動画工程で、長い1本ではなく短い生成区間へ分けた経緯と、因果を断定できない条件を確認する。

前工程で失われたSTATEを見る

「自然に書ける」と「状態を維持できる」は別だった

静止画段階で揺れた人物・場所・小道具を、生成単位をまたぐSTATE維持として整理する。

別の実務で役割分担を見る

Chatで考え、Workは確定操作だけにする――30商品から300商品へ変わった役割分担

このテーマをもっと見る

思考・実行・確認の分離

AIの思考、外部操作、保存確認を分離して安全に進めるKnowledge群。

上位カテゴリ

AIとの仕事設計(AI WORKFLOW)

人間の判断を残しながら、長時間・複数工程の仕事をAIへ任せるための運用設計。

すべてのテーマから探したい場合は、Knowledge一覧へ戻る。

bottom of page