Gemini 3.8 Flash TTSとは──Google Vidsのナレーションは日本語で使えるか

Googleは公式ブログ(日付は2026年9月23日)で、文章を読み上げ音声にする音声合成(TTS)モデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発表しました。動画づくりツールのGoogle Vidsと、旧NotebookLMのGemini Notebookにも載るとされています。ただし日本語で使えるか、どのプランが対象かは、発表文には書かれていません。分かっていることと未確定のことを分けて整理します。
何が変わったか
Googleは、今回の2モデルを「これまでで最も表現力の高い音声モデル」と位置づけています。TTS(Text-to-Speech)は、入力した文章を人の声のような音声にする技術のことです。発表文で挙げられている主な内容は次のとおりです。
- ●役割・アクセント・声の特徴を文章で指示して、新しい声を一から作れる(100以上の言語と方言にまたがって、とされています)
- ●すぐ使える声のライブラリが2,000種類以上
- ●30秒の音声サンプルから、同じ声質を再現できる(ボイスクローニング)
- ●行ごとの演技指示、数時間にわたる長い音声、2人の掛け合いの場面づくりに対応
- ●声を微調整する「リミックス」は近日提供予定
- ●生成された音声には、聞こえない電子透かし「SynthID」が入る
提供先は2モデルで異なります。Flash TTSはGemini Notebook、Flash-Lite TTSはGoogle Vidsで、いずれも発表文では「For everyone」と書かれています。開発者向けには、両モデルともGemini APIとGoogle AI Studioで発表日から提供とされ、Gemini Enterpriseは「近日提供予定」です。
気になる「今、誰が・日本で使えるのか」ですが、対象プランと日本での提供状況は、発表文に記載がありません。料金の記載もありません。「For everyone」は「全員が使える」と読めますが、国やプランの範囲までは示されていないため、日本のどのプランで使えるかは未確定として扱うのが安全です。なお、Vidsの日本語ヘルプでは、AIナレーション機能を使うには対象のGoogle WorkspaceまたはGoogle AIのプランへの登録が必要と案内されています。
日本語については次の状況です。発表文には、人が聞き比べて好みを選ぶ評価「Voice Arena」で、日本語を含む主要言語で上位に入ったという記述と、日本の題材を使った音声サンプルへの言及があります。一方で、100以上の言語に日本語が含まれると明記した文はなく、VidsやGemini Notebookの日本語の画面で使えるとも書かれていません。参考までに、2026年4月の前モデル「Gemini 3.1 Flash TTS」は日本語を含む70以上の言語に対応と報じられ、Vidsの現行ヘルプにも日本語を含む24言語のAIナレーションという案内があります。ただし、これらが今回の3.8モデルでも同じとは、どちらの資料からも確認できません。
順位づけなどの評価結果は、Google側が示したものです。第三者が日本語の業務用途で検証した数字ではありません。また、Flash TTSとFlash-Lite TTSの性能差や料金差は、発表文からは読み取れませんでした。
業務での使いどころ
画面に出てくる場合、いちばん現実的なのは、Vidsで作る社内向け動画のナレーションです。ナレーションを録り直すたびに人の時間が取られている職場ほど、効果が出やすい部分です。
- ●向く仕事:社内研修・手順説明動画の仮ナレーション、商品やサービス紹介動画の下書き、社内向けお知らせ動画
- ●向かない仕事:読み間違いが許されない本番の案内音声、人名・地名・型番が多い原稿(確認なしでそのまま使うのは避ける)
- ●慎重に扱う仕事:他人の声の再現。発表文でも、声の再現には声の持ち主の同意録音が必要とされています
- 1台本を1シーン分ずつ、短く区切って作る(長い1本にまとめない)
- 2Vidsのナレーション機能に台本を貼り、声を選んで試聴する(操作画面はヘルプの現行案内に沿ったもので、3.8への切り替え後に変わる可能性があります)
- 3固有名詞・数字・英字の読みを耳で確認し、読み間違いを台本側で直す
- 4社外に出す動画は、公開前に担当者がナレーションを最後まで通しで聞く
以下は業務手順書の一部です。動画のナレーション台本にしてください。 ・1シーンにつき、読み上げて20〜30秒程度の長さにする ・シーンごとに「シーン1」「シーン2」と分けて出す ・話し言葉にする。1文は短く、40文字以内を目安にする ・絵文字・記号・太字は使わない ・数字は読み方のとおりにひらがなで補う(例:3件 → さんけん) ・元の手順書に書かれていない内容は足さない ・読み方が分かれそうな固有名詞には、最後に「読み確認リスト」として一覧にする --- 手順書ここから --- (ここに貼り付け)
以下のナレーション台本を、音声合成で読み上げるつもりでチェックしてください。 1. 読み間違いが起きやすい語(固有名詞、数字、英字、同じ漢字で読みが複数ある語)を一覧にする 2. それぞれ、どう書き換えれば誤読が減るかを提案する 3. 不明な語は推測で直さず、「要確認」と書く --- 台本ここから --- (ここに貼り付け)
台本の段階で読みを直しておくと、音声を作り直す回数が減ります。聞いてから直すより、聞く前に直すほうが手間が少なくなります。
試すときに気をつけること
==日本語での対応と対象プランは、発表文で確認できていません==
ミーネクスト編集部は、日本の画面で3.8モデルのナレーションが使えることを確認していません。日本語が使えるか、自分のプランで使えるか、料金がかかるかは、発表文に記載がなく未確定です。発表直後は段階的に反映されることもあるため、Vidsやノートブックの画面に機能が出ていなくても、設定の間違いとは限りません。まず自分のアカウントの画面で、ナレーション機能が出ているかを確認してください。
- ●会社のGoogle Workspaceは、管理者が機能の提供時期や範囲を決めていることがあります。画面に出ないときは、まず管理者に確認する
- ●生成された音声は、公開前に必ず人が聞く。読み間違いは台本の書き方で減らせるが、ゼロにはならない
- ●声の再現(30秒のサンプルから)は、本人の同意が前提。社員や取引先の声を、本人の了承なしに使わない
- ●発表文によると、声の再現機能はイリノイ州・テキサス州・欧州経済領域・英国・スイス・インドでは使えません。日本は挙がっていませんが、日本で使えるとも書かれていない
- ●まずは社内向けの動画など、外に出ない用途から試す
出典
社内で使えるようにしたい方へ
記事の内容を自社の業務に合わせて落とし込む、生成AIの研修も実施しています。 業種・職種に合わせた内容でご相談いただけます。
研修について相談する他のAIニュース
GPT-6 Sol・LunaのAPI料金は20倍差──自社システムでどちらを選ぶか・切り替え前の確認点
OpenAIがAPIで公開したGPT-6 SolとGPT-6 Luna。料金は100万トークンあたり入力2ドルと0.1ドルで20倍の差があります。gpt-6-sol・gpt-6-lunaの使い分けと、自社システムや業務ツールで切り替える前に確かめることを整理しました。

Google Meetの自動メモに「クイックメモ」タブ──対象プランと会議後の確認・共有での使い方
Google Meetの自動メモ生成(Take notes for me)に、要点とアクションアイテムだけを1ページで読める「クイックメモ」タブが既定で追加されました。対象プラン、日本語の会議での扱い、議事録の確認・共有での使い方を整理しました。

Google Meetの自動メモが3人以上の会議で既定オンに──9月29日から、対象プランとオフにする設定
Google Meetの「自動メモ作成(Take notes for me)」に、3人以上の会議だけ自動でオンにする設定が追加。Business Standard/Plusは既定オンで、社外との打ち合わせでも記録が始まり得ます。管理者と各自が確認すべき設定をまとめました。

Geminiの学習用ノートブックが会社アカウントで解禁──管理コンソールの設定と研修教材での使い方
Geminiの「学習用ノートブック(study notebooks)」が、会社や学校が発行したGoogleアカウントでも使えるようになりました。対象プランと日本での提供状況、管理コンソールで必要な設定、社内研修の教材づくりでの使いどころを整理します。

