特集記事 一覧へ
Feature / Gemini 3.8 Flash TTS

じぇみちゃん、 声を手に入れる。

2026年9月22日(米国時間)、Googleが音声生成AI Gemini 3.8 Flash TTS を正式公開しました。 声を選び、演技をつけ、文章で説明するだけで新しい声まで作れる モデルです。 この特集の解説動画は、じぇみちゃん本人の声—— つまり Gemini 3.8 Flash TTS そのもの で作りました。

🎙
Video

まずは、じぇみちゃんの声で

約2分で、何ができて、どう使うのかをじぇみちゃんが案内します。 音が出るので、音量に気をつけて再生してください。

声:Gemini 3.8 Flash TTS(声 Erinome)/ BGM:Python のコードで自作
Chapter 1

何が出たの? 2つのモデル

出たのは、表現力の Flash TTS と、速さと安さの Flash-Lite TTS の2つ。 4月にプレビューで出た3.1 Flash TTSの後継で、今回は最初から正式版(GA)です。

130 言語
日本語もOK

Flash TTS の対応言語数。Flash-Lite TTS は101言語。どちらも日本語に対応しています。

2,000+ 声
声の種類

Googleの発表の数字。開発者向けの更新履歴では「150以上」と書かれていて、数え方に幅があります。

約1.4 セント/分
1分しゃべらせて

Flash TTS の出力料金から計算(2026年12月31日まで)。無料枠もあります。

表現力の看板モデル

🎭 Gemini 3.8 Flash TTS

  • モデル名 gemini-3.8-flash-tts
  • 演技力・声の細やかさを重視
  • 130言語、方言や長い朗読にも強い
  • ナレーション・物語・動画向き
速さと安さの働き者

⚡ Gemini 3.8 Flash-Lite TTS

  • モデル名 gemini-3.8-flash-lite-tts
  • 速い・安い。3.1 Flash TTS の置き換え役
  • 101言語
  • 音声エージェント・読み上げ・大量処理向き

評判は、 上々のすべり出し。

Googleは、Hume AI の「声のデザイン」のベンチマークで 1位(71.4) だったと発表しています。 第三者の Artificial Analysis でも、発音の正確さで 89.5%の1位 と報じられました(2026年9月23日時点)。 人が聞き比べる評価では、日本語 を含む主要な言語で上位に入った、ともGoogleは書いています。 ただし前の2つはGoogle側の発表なので、順位は自分の耳で確かめるのがいちばんです。

Chapter 2

声の選び方は 4段階

「用意された声から選ぶ」から「自分で声を作る」まで、4つの段があります。 いちばん手軽なのは①、今回いちばん新しいのは③です。

プリセットの30種

名前を指定するだけ

Kore(きっぱり)、Puck(元気)、Leda(若々しい)、Erinome(クリア)など、性格の説明つきの30種。まずはここから。

ボイスライブラリ

言語・性別・高さで探す

もっと大きな声の棚。言語や性別、声の高さ、キャラクター性で絞り込んで探せます。

ボイスデザイン

文章で説明して声を作る

「30代の、はきはきしたスポーツ実況の女性」のように説明すると、新しい声を作って保存できます。作った声はIDで何度でも呼べるので、キャラの声がぶれません。

ボイス複製

本人の同意が条件

10〜30秒の録音から、その人の声を再現します。同じ人が読んだ同意の文章の録音が必須で、他人の声を勝手に使うことはできないしくみです。

Chapter 3

演技は 「style」とタグでつける

同じ声でも、指示しだいで、元気にも、ひそひそ声にも、真剣にもなります。 指示の書き場所は3つです。

🎭

話し方は「style」に

「ひそひそ声で」「少し真剣に」「ゆっくり説明するように」など、そのセリフ全体の話し方。セリフ本文とは別の欄に書きます。日本語で書いても使えます(この特集の動画も日本語で指示しました)。

😆

一瞬の音は「タグ」で

<laugh>(笑う)、<sigh>(ため息)、<short pause>(ひと呼吸)などを本文の中に入れます。日本語の台本でも、タグは英語のまま書くのが決まりです。

👭

2人の掛け合い

話し手を2人まで決めて、1回で会話を作れます。セリフごとにどちらが話すかを必ず書くのが3.8のルールです(プリセットの声のみ)。

🔠

強調は大文字で

英語の台本なら、強く言いたい単語を大文字で書くと強調されます。

じぇみちゃん(Gemini)
Casting

動画のじぇみちゃんの声

gemini-3.8-flash-tts 声 Erinome(クリア) 全17セリフ

上の動画は、プリセットの声 Erinome に、次の話し方の指示を組み合わせて作りました。 ひそひそ声や、得意げ、お別れのあいさつなど、場面ごとに指示を少しずつ足しています。

🎀 ふだんの話し方

「とびきり可愛く、甘くてキラキラした声で、明るく元気に、はずむように、少し早口で」

🤫 ひそひそ話の場面

「ひそひそ声で、内緒話のように、とびきり可愛く」——声はかなり小さくなるので、動画では音量を少し上げています。

Chapter 4

3.1から、ここが変わった

前のモデルで作った台本やプログラムは、そのままでは期待どおりに動かないことがあります。

3.1 Flash TTS まで

📝 指示も台本に混ぜられた

  • 「明るく言って:」を本文の頭に書けた
  • 長い「演出メモ」で声の性格を指示
  • 返ってくるのはヘッダーなしの生データ
  • generateContent という書き方
3.8 Flash TTS から

🎯 台本は「書いた通りに読む」

  • 本文の指示はそのまま読まれる。指示は style 欄へ
  • 声の性格はボイスデザインで先に作る
  • WAVファイルで返ってくる(24kHz・モノラル)
  • 新しい Interactions API で呼ぶ
Chapter 5

使ってみよう:ブラウザでも、コードでも

試すだけならブラウザで十分。自分のアプリや動画づくりに組み込むならAPIです。

STEP 1 🌐

Google AI Studio を開く

音声生成のページ(aistudio.google.com/generate-speech)を開きます。Googleアカウントがあれば、無料枠で試せます。

STEP 2 🎤

声を選ぶか、作る

プリセットやボイスライブラリから選ぶか、ボイスデザインで文章から声を作ります。

STEP 3 ▶️

台本を入れて再生

台本と話し方を入れて再生。気に入った声は voice_… のID をコピーすれば、APIからも同じ声で呼べます。

API

APIは 「文章・話し方・声」の3点セット

Gemini API のキーを AI Studio で発行し、読み上げる文章、話し方(style)、声の名前(または voice_… のID) を送るだけです。 返ってきた音声は base64 という文字の形なので、元に戻して .wav として保存します。

ターミナルから1回だけ試す(curl)
① キーを入れておく(AI Studio で発行したもの)
$ export GEMINI_API_KEY="あなたのキー"
② 文章・話し方・声を送って、out.wav に保存(jq が必要)
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \ -H "x-goog-api-key: $GEMINI_API_KEY" -H "Content-Type: application/json" \ -d '{"model":"gemini-3.8-flash-tts","input":[{"type":"user_input","content":[{"type":"text","text":"やっほー!じぇみちゃんだよ。","annotations":[{"type":"speech_metadata","style":"明るく元気に"}]}]}],"response_format":{"type":"audio"},"generation_config":{"speech_config":[{"voice":"Erinome"}]}}' \ | jq -r '[.steps[] | select(.type=="model_output") | .content[] | select(.type=="audio")] | last | .data' \ | base64 --decode > out.wav
✓ out.wav に、じぇみちゃんの声が保存される

※ 書き方は Gemini API 公式ドキュメント(ai.google.dev)にもとづく2026年9月26日時点のものです。
キーは人に見せないでください。ページやプログラムに直接書き込まず、環境変数などで渡すのが安全です。

Python で使う(google-genai 2.25.0 以上)
ライブラリを入れる
$ pip install -U google-genai
tts.py として保存して実行
import base64 from google import genai client = genai.Client() res = client.interactions.create( model="gemini-3.8-flash-tts", input=[{"type": "user_input", "content": [{ "type": "text", "text": "やっほー!じぇみちゃんだよ。", "annotations": [{"type": "speech_metadata", "style": "明るく元気に"}], }]}], response_format={"type": "audio"}, generation_config={"speech_config": [{"voice": "Erinome"}]}, ) with open("out.wav", "wb") as f: f.write(base64.b64decode(res.output_audio.data))

※ 3.1以前の解説記事にある generate_content + WAVヘッダーを自分で付ける書き方とは別物です。古いコードは、そのままでは使えません。

Chapter 6

お値段は 年内は割引価格

料金は「100万トークンあたり何ドル」。音声は 1秒=25トークン なので、1分の音声は1,500トークンです。 いまの値段は 2026年12月31日まで の価格で、2027年1月1日から2倍になります。

モデル 入力(文章) 出力(音声) ひとこと
3.8 Flash TTS
表現力の看板
$0.50 $9 1分で約1.4セント。2027年からは $1 / $18。
3.8 Flash-Lite TTS
速さと安さ
$0.50 $6 1分で約0.9セント。2027年からは $1 / $12。
バッチ(まとめて処理)
急がない仕事
半額 半額 Flash TTS なら $0.25 / $4.50。
3.1 Flash TTS
前のプレビュー版
$1 $20 新しい 3.8 のほうが、年内はずっと安い。

※ 価格は Gemini API の公式料金ページにもとづく2026年9月26日時点のもので、すべて100万トークンあたり。
無料枠もありますが、無料枠で送った内容は Google のサービス改善に使われます(有料枠では使われません)。

Chapter 7

使う前に、知っておきたいこと

⚠️ 気をつけたい5つ

  • 声の複製は、本人の同意が必須。同じ大人の話し手が、決められた同意の文章を読んだ録音が要ります。録音する機材が違うと、同じ人だと認めてもらえないことがあります。
  • 作った音声には「電子透かし」が入る。GoogleのGemini Audioの音声には、AIが作った印の SynthID が入ります。聞いても分かりませんが、あとから見分けられるしくみです。
  • 1回で掛け合いできるのは2人まで。しかもプリセットの声だけ。自分で作った声どうしで会話させたいときは、1人ずつ作ってつなぎます。
  • 会社向けのGoogle Cloud(Vertex AI)では、まだ使えない。2026年9月26日時点で使えるのは、Gemini API と AI Studio。Gemini Enterprise は「近日対応」とされています。
  • 台本の書き方が変わった。前のモデル向けに「明るく言って:」と本文に書いた台本は、その指示まで読まれてしまいます。指示は style 欄へ移しましょう。
Choose → Direct → Design

放送部の部長に、 ほんとうのマイクが届いた。

声を選び、演技をつけ、足りなければ文章で新しい声を作る。 これまで録音スタジオと声優さんが必要だった仕事の入口が、台本を書ける人なら誰でも 立てる場所まで下りてきました。 台本さえ書ければ、声はあとからついてくる。放送部の部長は、その入口に立つための道具を、みんなに配りはじめたところです。 まずは AI Studio で、好きな声を1つ見つけるところから。

Related

あわせて 読みたい