Shiny Academy

AI×動画制作コース

~第5話 AIが文字を起こし、人がテロップにする~

前回のあらすじ

約200カットの撮影素材から、冒頭3秒のフックに「さぬきビートで子どもが踊る瞬間」を選定した。サムネイルのキャッチコピー「踊って打つ、親子うどん」もAI案から決定し、15秒ショート動画版の構成まで設計した。

AI文字起こしの驚きと落とし穴

事務所のPCモニターにAI文字起こしの結果が表示され、神谷と宮本が誤変換箇所を確認している場面

フックとサムネイルが決まり、動画の全体構成が形になってきた。次は映像にテロップ(動画の画面に重ねて表示する文字。話した内容を文字にした字幕もこれに含まれる)を載せる工程だ。テロップを作るにはまず、映像に含まれる音声を文字に変換する必要がある。

西園寺遥の表情アイコン
西園寺
今日はテロップの工程に進みましょう。最初のステップは、撮影現場で録った音声——藤原さんの説明や、体験した人たちの声——のAI文字起こしよ。音声ファイルをツールに読み込ませてみて

神谷が現場で録った音声のファイルをツールにアップロードすると、進行バーが動き始めた。3分ほどで処理が完了し、画面にテキストがずらりと並ぶ。音声を自動でテキストに変換する——これがAI文字起こしだ。

神谷悠馬の表情アイコン
神谷
すごい……ほぼ正確です。3分で現場の音声が全部文字になるなんて。手で書き起こしていたら、何度も聞き直して何十分もかかっていたはずです
西園寺遥の表情アイコン
西園寺
「ほぼ」のところを見てみて。固有名詞のあたりを確認してみてくれる?

神谷が変換結果を上から順に読み返していくと、3箇所で違和感に気づいた。「屋島」が「八島」に、「さぬき体験工房」が「讃岐体験工房」に、「やしまーる」が「屋島丸」になっている。どれも音は似ているが、表記がまったく違う。

宮本彩の表情アイコン
宮本
あ、「屋島丸」って……船の名前みたいですね。「やしまーる」はひらがなと長音符なのに、漢字の「屋島丸」に変わっちゃってます
神谷悠馬の表情アイコン
神谷
「さぬき体験工房」も同じです。ひらがなの「さぬき」が「讃岐」になっています
西園寺遥の表情アイコン
西園寺
AI文字起こしは一般的な単語にはとても強いの。でも地名や施設名のような固有名詞は、AIの学習データにない表記だと、似た音の別の漢字に置き換えてしまうことがあるのよ。これがAI文字起こしの弱点ね

一般的な単語は高い精度でテキスト化されるが、地域に固有の表記はAIが判断を誤りやすい。大部分は自動で速く処理できるが、固有名詞のように「正解が1つしかない」語だけは、必ず人の目で確認して修正する必要がある。

西園寺遥の表情アイコン
西園寺
さっそく3箇所を正しい表記に直していきましょう。こういう修正は、現場の地名を知っている人が見ると一瞬でわかるのよ

神谷と宮本で、変換結果を1行ずつ照合しながら修正していった。「八島」を「屋島」に、「讃岐体験工房」を「さぬき体験工房」に、「屋島丸」を「やしまーる」に。宮本がフィールドノートに控えておいた地名リストと見比べながら、ほかにも誤変換がないか丁寧に確認した。修正作業は15分ほどで終わった。

テロップの2つの役割

テロップの2つの役割「伝える」と「強める」を左右に並べて比較した概念図

固有名詞の修正が終わり、正確なテキスト原稿が完成した。次はこの原稿をもとに、映像にテロップを重ねるデザイン作業に入る。まず神谷が試したのは、その原稿をほぼそのままテロップにする方法だった。音を消しても動画の意味が伝わるように、話し言葉を全文テキスト化して画面下部に載せた。

神谷悠馬の表情アイコン
神谷
西園寺さん、現場で録れた話し声を、そのまま全部文字にしてみました。これなら電車の中で音を出せなくても、内容が伝わると思うんですけど……
西園寺遥の表情アイコン
西園寺
なるほどね。体験工房の映像を再生しながら見てみましょう

再生してみると、画面の下半分がテロップで埋まり、うどんを踏む子どもの表情や足元の動きがほとんど見えない。文字を読むことに意識が引っ張られて、映像そのものの迫力が薄れてしまう。

神谷悠馬の表情アイコン
神谷
文字は読めるんですけど、肝心の映像が見えなくなりますね……。じゃあ、キーワードだけを大きく表示してみたらどうでしょう

今度は「さぬきビート」「親子で踏む」といったキーワードだけを大きなテロップにした。映像のインパクトは増したが、何を言っているのかがまったく伝わらない。

神谷悠馬の表情アイコン
神谷
どちらを選んでも何かが犠牲になります……全文を載せると映像が見えないし、キーワードだけだと内容が伝わらない。どうすればいいんでしょうか
西園寺遥の表情アイコン
西園寺
その迷い方が正しいのよ。それはテロップに2つの役割があるからよ。1つは「何を言っているか伝える」ことね。もう1つは「映像の印象を強める」ことよ。今あなたが体験した通り、この2つは時に矛盾するの
西園寺遥の表情アイコン
西園寺
だから映像ごとにどちらを優先するか決めるのよ。今回の体験工房の映像は、子どもの表情やうどんを踏む動きが主役でしょう。テロップで「強める」よりも、映像を「邪魔しない」ことのほうが大事よ
宮本彩の表情アイコン
宮本
たしかに、さぬきビートの映像は動きを見てもらうのがいちばんですもんね。テロップが目立ちすぎたら、肝心の体験の様子が伝わらなくなりそうです

テロップには「伝える」と「強める」の2つの役割がある。映像の内容や目的によって、どちらを優先するかが変わる。体験工房のさぬきビートの映像は、体験そのものの空気感を活かすために、テロップは控えめに「伝える」役割を中心にすることになった。

テロップデザインの試行錯誤

テロップの4つのデザインパターンを2×2で比較し、白文字+薄い影を採用した概念図

方針が決まり、神谷がフォント(文字の書体)・文字サイズ・位置・背景の組み合わせを変えて、複数のパターンを試していく。

神谷悠馬の表情アイコン
神谷
まず、白い文字に太い黒縁取りを入れてみました。はっきり読めるんですけど……
西園寺遥の表情アイコン
西園寺
読みやすいけれど、テロップだけが映像から浮いて見えるわね。縁取りが太いと、文字が貼りつけたシールのように見えてしまうの

次に神谷が試したのは、画面下部に半透明の黒い帯を敷き、その上に白文字を載せるパターンだった。文字は読みやすく、安定感がある。しかし帯の部分が映像を覆い隠してしまい、うどんを踏む子どもの足元が見えなくなる。

3つ目は、文字をポップな吹き出しの中に入れるデザインだ。見た目は華やかだが、バラエティ番組のような印象になり、体験工房のリアルな空気感とは合わない。

宮本彩の表情アイコン
宮本
3つ目だと楽しそうには見えるんですけど、体験工房の雰囲気とはちょっと違う感じがしますね
神谷悠馬の表情アイコン
神谷
どれも一長一短ですね……西園寺さん、体験工房の映像にいちばん合うのはどのパターンでしょうか
西園寺遥の表情アイコン
西園寺
正解が1つだけあるわけじゃないのよ。映像の雰囲気に合わせて選ぶの。今回は「体験のリアルな空気」を活かしたいから、テロップは控えめにしましょう。白文字に薄い影だけを落とすパターンを試してみて

神谷が白文字に薄い影だけを落としたパターンを適用した。映像を邪魔しないのに、文字はちゃんと読める。テロップが映像の一部のように自然に馴染んでいた。

宮本彩の表情アイコン
宮本
あ、これだとテロップが映像の邪魔をしてないですね。文字もちゃんと読めます

チームで画面を確認し、体験工房の動画には「白文字+薄い影」が最も合うと全員が納得した。テロップの位置は、縦型のショート動画では画面の下端2割ほどにSNS側のボタンやキャプションが重なるため、そこを避けて画面中央よりやや下に固定し、うどんを踏む手元の映像と重なる箇所だけ、一時的に画面上部へ移動させることにした。

西園寺遥の表情アイコン
西園寺
テロップの位置も映像に合わせて動かすのよ。基本は下に置いて、手元のアップと被るところだけ上に逃がす。位置が固定じゃなくても、見る人は自然に目で追えるから安心してね

スマートフォンで見ると文字が小さい

同じテロップがPC画面とスマホ画面でどう見えるかを比較し、文字サイズ1.5倍の改善後を示した概念図

テロップのデザインが決まり、通しで動画を再生して確認した。PCの大画面で見る限り、テロップは映像に自然に馴染み、文字も読みやすい。チーム全員が「これで完成でいい」と思いかけたとき、宮本が画面を見つめたまま声を上げた。

宮本彩の表情アイコン
宮本
あの……でもこれ、スマートフォンで見ると文字が小さくないですか?
神谷悠馬の表情アイコン
神谷
スマートフォンですか? PCでは問題なく読めていると思いますけど……
宮本彩の表情アイコン
宮本
私、さっきから手元のスマートフォンでも同じ動画を再生してたんです。そうしたら、PCでは読めるテロップがスマートフォンだと全然読めなくて

神谷が自分のスマートフォンでも動画を再生してみた。PCの大画面では適切だったテロップが、スマートフォンの小さな画面では驚くほど小さい。目を凝らしてようやく読める程度で、これでは電車の中や暗い部屋で気軽に見る状況には耐えられない。

西園寺遥の表情アイコン
西園寺
自分で試してみたのが大きいわ、宮本さん。この動画を見るのはPCじゃなくてスマートフォンよ。林田家のお母さんが夜にスマートフォンで見る——その画面サイズで読めなければ意味がないの
神谷悠馬の表情アイコン
神谷
PCの画面で編集していると、つい大画面の見え方だけで判断してしまいますね……盲点でした

文字サイズを1.5倍に拡大し、改めてスマートフォンで再生した。今度はしっかり読める。PCの画面では少し大きく見えるが、実際の視聴環境で読みやすいことが最優先だ。

宮本彩の表情アイコン
宮本
あ、今度はちゃんと読めます。スマートフォンでもテロップがはっきり見えますね
西園寺遥の表情アイコン
西園寺
最終確認は、届けたい相手の視聴環境で行うのが原則よ。今回のペルソナ(たった一人の理想の視聴者像)は夜にスマートフォンで動画を見る家族だから、スマートフォンの画面が基準になるの。PC画面で完璧に見えても、それは作り手の環境にすぎないのよ

「テロップの修正、私がやります」

テロップの文字サイズとデザインが確定し、ひと段落ついたところで、宮本がまっすぐ神谷のほうを見て言った。

宮本彩の表情アイコン
宮本
神谷さん、テロップの修正作業なんですけど……私がやってもいいですか?
神谷悠馬の表情アイコン
神谷
宮本さんが、ですか?
宮本彩の表情アイコン
宮本
はい。固有名詞の修正は、私のほうがわかるんです。「屋島」か「八島」か、「やしまーる」か「屋島丸」か——現場を知っている人間が見れば一瞬なんです。それに今日、スマートフォンでの見え方も自分で確認できたから、テロップのチェックは私にやらせてほしいんです

これまで動画の編集作業は神谷が中心で、宮本は横で意見を出す立場だった。しかし今日、AI文字起こしの固有名詞修正で自分の知識が役に立つと実感し、スマートフォンでの見え方にも自分で気づけた。「デジタルは神谷さんの担当」という線引きを、宮本が自分から超えようとしている。

神谷悠馬の表情アイコン
神谷
もちろんです。宮本さんのほうが地名に詳しいですし、スマートフォンでの確認も含めてお願いできると助かります
西園寺遥の表情アイコン
西園寺
心強いわ、宮本さん。文字起こしもテロップも、AIが速いの。でも「読みやすさ」と「正しさ」の判断は、人間の目と耳でしかできないわ。宮本さんの現場知識は、まさにその判断を支える力よ
宮本彩の表情アイコン
宮本
ありがとうございます。まずは固有名詞の一覧を作って、一つずつ確認していきますね

宮本の目が明るい。テロップの修正という具体的な作業を通じて、動画制作のワークフローに一歩踏み込んだ瞬間だった。


📌 覚えるポイント

  • AI文字起こしは音声を数分でテキストにでき、一般的な単語はほぼ正確に変換される。ただし誤りは地名・固有名詞のように「正解が1つしかない」語に集中するので、そこだけは必ず人の目で確認・修正する
  • テロップには「何を言っているか伝える」役割と「映像の印象を強める」役割がある。この2つは時に矛盾するので、映像ごとにどちらを優先するかを決める
  • 白文字+黒縁取り、半透明帯、吹き出し風——フォント・サイズ・位置は映像との相性で決まる。複数パターンを試して、映像を邪魔しないものを選ぶ
  • PCの大画面で作ったテロップは、スマートフォンでは文字が小さすぎて読めないことがある。仕上げる前に、ペルソナの視聴環境で必ず確認する
  • AI文字起こし→手動で固有名詞を修正→テロップデザイン→スマートフォンで確認。この流れをどこも飛ばさないことが、動画の読みやすさと正確さを支える

📖 覚える用語

AI文字起こし
音声をテキストに自動変換する技術。一般的な単語は高精度にテキスト化できるが、地名や固有名詞などAIの学習データにない表記は、似た音の別の漢字に置き換えてしまうことがある。自動化の速さに、人間の目による修正を組み合わせて使う
テロップ
動画に重ねる字幕のこと。「何を言っているか伝える」役割と「映像の印象を強める」役割の2つがある。映像の内容や目的によってどちらを優先するかが変わり、フォント・サイズ・位置を映像の雰囲気に合わせて選ぶ
📝 神谷の北村さんへの報告メモ
AI文字起こしの実施と固有名詞修正
撮影現場の収録音声をAI文字起こしツールで自動テキスト化しました。「屋島→八島」「さぬき体験工房→讃岐体験工房」「やしまーる→屋島丸」の3箇所に固有名詞の誤変換があり、宮本と確認しながら手動で修正しました
テロップデザインの決定
テロップのデザインを4パターン比較検討し、「白文字+薄い影」を採用しました。体験工房の映像の空気感を壊さない控えめなデザインです。テロップの位置は基本的に画面下部に置き、手元の映像と重なる箇所のみ上部に移動させます
スマートフォンでの文字サイズ調整と宮本のテロップ修正担当
宮本の指摘でスマートフォンでの見え方を確認したところ、文字が小さすぎたため1.5倍に拡大しました。今後のテロップ修正作業は、固有名詞に詳しい宮本が担当します

まとめ

テロップの工程は、AIの速さと人間の正確さが出会う場所だった。文字起こしの大半はAIが一瞬で片づけ、残った固有名詞を人の目が正す。デザインは映像の空気感に合わせて選び、最後の確認はPCではなく、届けたい相手のスマートフォンで行う。自動化が進むほど、人間が判断すべきポイントが明確になっていく。