KNOWLEDGE
12ページ絵本から4分30秒の読み聞かせ動画まで――物語→画像→動画→音声→BGMを自然言語中心でつないだ一人制作
著者:可児波起
確認日:
2026年9月27日
更新日:
2026年10月2日
ANSWER
【結論】
生成AI絵本『べんりな国とさびしいナギ』は、物語設計→文字入り12ページ→表紙→Grok動画化→AI音声→BGMまで自然言語中心で一人制作しました。最 終的に4分30秒の読み聞かせ動画になった例で、特定AI機能の性能比較ではありません。

Explanation
【詳しく解説】
結論――一つの作品を、文章・画像・動画・音声へ段階的に変換した
この制作の特徴は、最初から「マルチモーダル作品を作ろう」と工程を固定していたことではありません。最初は生成AIで絵本を作る企画でしたが、制作が進むにつれて、静止画絵本から動画、読み上げ、BGM、SNS投稿へ段階的に広がりました。
結果として、同じ物語とキャラクターを核に、文章、ページ画像、表紙、動画、音声、音楽という異なるメディアを一人でつなぐ制作フローになりました。
最初に決めたのは、AI機能ではなく物語だった
作品では、便利になった世界で人が本当に欲しかったのは正しい答えだけではなく、共感、寄り添い、心に届く言葉だった、というテーマへ収束しました。さらに「効率化や自動化は便利だが、自分で成し遂げた手ごたえが薄れる」という第二のテーマが加わりました。
主人公は人間の子ども「ナギ」、相棒は光の存在「アカリ」。タイトルは『べんりな国とさびしいナギ』に決まり、本文12ページの骨子と文章を作りました。つまり、画像や動画より前に、作品のテーマ・人物・物語が先に確定しています。
画像制作では、12ページを「文字入り完成ページ」として作った
絵の方向性は、北欧絵本風のミニマルで洗練されたタッチを採用しました。ナギのキャラクター設定図、アカリのキャラクター設定図、絵本全体のトンマナ設定図を作り、その後、12ページすべてについて本文まで画像内に含めた完成ページを生成する方式へ移行しました。
可児 波起は、画像だけ作って後からPhotoshopなどで文字を載せる方法ではなく、会話で文章と絵の両方を指定し、完成ページまで持っていくことを選びました。ただし、制作記録ではGrokやCapCutも使用しているため、「すべての制作操作が自然言語だけだった」という意味ではなく、物語・画像・動画・音声の指示を自然言語中心で進めた、と整理するのが正確です。
絵本完成後、静止画をGrokで動画へ変えた
本文12ページと表紙を作ったあと、可児 波起は各画像をGrokで動画化しました。派手なアニメーションではなく、同じ動きがゆっくり反復する静かな動きへ寄せ、絵本の世界観を大きく変えない方向で動画へ拡張しています。
この段階は、既存KnowledgeのGrok動画化を高く評価しても、静止画の不一致は残ったや、いきなり動画を作らない――4コマ静止画を設計図にして、1コマずつGrokへ渡した制作方法と同じく、静止画を動画AIへ渡す工程を含みます。ただし今回のKnowledgeは、その一工程ではなく、絵本から音声・BGMまでを含む全体フローを扱います。
CapCutでは、AI音声とBGMを加えた
動画化した素材に、CapCutでAI音声を付与しました。読み上げはウィスパー系の声を選び、BGMにはオルゴール的な音を使いました。
ここでは、声やBGMをAIが自動的に決めたのではありません。どの声質、どの音楽、どの動きが作品世界に合うかを可児 波起が選択し、最終的に全長4分30秒の読み聞かせ動画へ仕上げています。
最終成果は、絵本だけではなく「作品の変換履歴」まで残った
制作記録上で確認できる成果には、タイトル、12ページ本文、ナギ設定図、アカリ設定図、トンマナ設定図、12ページの文字入り画像、表紙、9:16無地背景、動画化、AI読み上げ、BGM追加、全長4分30秒の読み聞かせ動画、SNS投稿が含まれます。
SNS投稿画面には「生成AIによる『北欧風絵本』13ページ」という記載もあり、表紙+本文12ページと解釈できますが、その13ページの内訳を投稿画面だけで完全に検証したわけではありません。本Knowledgeでは、本文12ページと表紙が別途確認されている事実を基準にします。
「1つのAIですべて作った」わけではない
この制作では、ChatGPTだけで全工程を完結していません。ChatGPTとの会話で物語、本文、設定図、画像制作を進め、Grokで静止画を動画化し、CapCutでAI音声とBGMを加えています。
そのため、価値の中心は「万能AIが一つの作品を自動生成したこと」ではなく、複数のAI・編集工程を一人が同じ作品世界へつないだことにあります。AIごとの役割を切り替えながら、テーマ、世界観、声、音、動きを一貫させる人間側の判断が残っています。
自然言語は、作品の「操作盤」として使われた
可児 波起はこの制作を振り返り、「生成AIは凄い新機能ではなく、自分の中にある抽象的なものを具現化する高度なツールになった」と表現しています。
この意味で自然言語は、単なるプロンプト入力ではなく、テーマ、物語、キャラクター、画風、ページ内容、動き、声、音の方向を言葉で指定する操作盤として使われました。完成作品の品質が自然言語だけで自動保証されたわけではなく、途中には多数の手戻りと修正があります。
確認できたことと、まだ確認できていないこと
確認できたこと:本文12ページを制作したこと。ナギとアカリの設定図、トンマナ設定図、12ページ画像、表紙、9:16背景を生成したこと。Grokで静止画を動画化したこと。CapCutでAI音声とBGMを加えたこと。ウィスパー系音声とオルゴール的BGMを採用したこと。完成動画が全長4分30秒だったこと。SNS投稿まで行ったこと。
確認できていないこと:同じ方法の他作品での再現性、制作時間・コストの比較、Photoshop等を使う従来制作との品質比較、動画全編をこのKnowledge制作時に再生して評価した結果、一般視聴者による完成作品評価。
作品を英語で紹介する段階の確認例として、生成AIで作った音楽を作品として届けるために、楽曲・ジャケット・紹介文を組み合わせた記録があります。制作済みの報告と配信予定を区別した、実際の日本語と英訳を読めます。
実務との接続:物語・画像・映像・音声をつないだ制作の実務例は、海辺の部屋の動画制作ポートフォリオでも確認できます。
このKnowledgeの関連知識
静止画→動画工程の詳細:Grok動画化を高く評価しても、静止画の不一致は残った。複数AI工程のどこが品質を止めるかを見る。
動画素材の作り方:いきなり動画を作らない――4コマ静止画を設計図にして、1コマずつGrokへ渡した制作方法。静止画を動画へ渡す前工程を見る。
人間とAIの創作分担:「心臓は人間、AIは骨格と呼吸」――恋愛小説づくりで見えた創作分担。媒体を越えて、人間とAIが何を担当するかを比較する。
EVIDENCE
【根拠・検証】
Evidence
【直接確認できる事実|制作範囲】
制作は、物語設計→キャラクター設計→トンマナ設計→12ページの文字入り絵本→表紙→動画化→AI音声→BGM→SNS投稿まで発展しました。
【直接確認できる事実|絵本】
タイトル『べんりな国とさびしいナギ』、本文12ページ、ナギ設定図、アカリ設定図、トンマナ設定図、12ページの文字入り画像、表紙、9:16無地背景まで作成されました。
【本人報告+制作記録|動画化】
静止画をGrokで動画化し、CapCutでAI音声を付与しました。読み上げはウィスパー系、BGMはオルゴール的な音を採用し、動画長は全4分30秒と報告されています。
【直接確認できる事実|公開】
SNSへの投稿実施が本人報告と画面で確認されています。LinkedIn画面には「生成AIによる『北欧風絵本』13ページ」という投稿タイトルと167インプレッションが表示されていました。
【AIによる分析】
この制作を、一人が自然言語を中心に物語・画像・動画・音声・音楽を同じ作品世界へつなぐマルチモーダル制作フローとして整理しました。
【未確認事項】
他作品での再現性、従来制作との時間・コスト・品質比較、動画全編の直接評価、第三者による作品評価は未確認です。
Evidence Snapshot
確認日:2026年9月27日
元になった出来事:生成AIで作った12ページ絵本を、静止画だけで終わらせず動画・音声・BGM・SNS投稿まで拡張した。
Before / After:文字入り絵本+表紙 → Grokで動画化 → CapCutでAI音声とBGMを追加した読み聞かせ動画。
実測・確認値:本文12ページ。完成動画は4分30秒。SNS投稿画面では167インプレッションを確認。
未確認事項:他作品での再現性、従来制作との時間・コスト・品質比較、第三者評価は未確認。
公開範囲:非公開記録そのものではなく、この記事で確認できる事実・実測・未確認事項だけを要約しています。
SOURCES
【情報源】
Sources
PRIMARY SOURCE|非公開一次記録
可児 波起とChatGPTによる絵本『べんりな国とさびしいナギ』制作の会話・生成記録。物語設計、12ページ本文、キャラクター設定図、トンマナ設定図、文字入り画像、表紙、動画化、AI読み上げ、BGM、SNS投稿までの制作過程を確認しています。
PRIMARY SOURCE|非公開一次記録|制作物・画面
ナギ設定図、アカリ設定図、トンマナ設定図、1〜12ページ画像、表紙、SNS投稿スクリーンショット、動画の複数スクリーンショットが一次資料として記録されています。
確認範囲
このKnowledgeでは、GrokやCapCutの公式仕様を方法の優位性の根拠にはしていません。4分30秒という動画長、声・BGMの選択、制作ツールの使用は会話内の本人報告と制作記録に基づきます。
Author
【著者】
可児波起
マーケティングデザイナー / DXコンサルタント / 音楽家
次に読む
静止画→動画の工程を詳しく見る
Grok動画化を高く評価しても、静止画の不一致は残った――ChatGPT→Grok制作で前工程を切り分けた実例
動画素材づくりへ進む
いきなり動画を作らない――4コマ静止画を設計図にして、1コマずつGrokへ渡した制作方法
創作分担の考え方を見る
「心臓は人間、AIは骨格と呼吸」――恋愛小説づくりで見えた創作分担
このテーマをもっと見る
AIとの反発・即興・共同制作から人間の創造性を引き出すKnowledge群。
上位カテゴリ
人間とAIの役割分担、漫画・映像・物語制作、作品のContinuityを、実制作のEvidenceから整理する。
