2026年9月22日(米国時間)、Googleが音声生成AI Gemini 3.8 Flash TTS を正式公開しました。 声を選び、演技をつけ、文章で説明するだけで新しい声まで作れる モデルです。 この特集の解説動画は、じぇみちゃん本人の声—— つまり Gemini 3.8 Flash TTS そのもの で作りました。
約2分で、何ができて、どう使うのかをじぇみちゃんが案内します。 音が出るので、音量に気をつけて再生してください。
出たのは、表現力の Flash TTS と、速さと安さの Flash-Lite TTS の2つ。 4月にプレビューで出た3.1 Flash TTSの後継で、今回は最初から正式版(GA)です。
Flash TTS の対応言語数。Flash-Lite TTS は101言語。どちらも日本語に対応しています。
Googleの発表の数字。開発者向けの更新履歴では「150以上」と書かれていて、数え方に幅があります。
Flash TTS の出力料金から計算(2026年12月31日まで)。無料枠もあります。
Googleは、Hume AI の「声のデザイン」のベンチマークで 1位(71.4) だったと発表しています。 第三者の Artificial Analysis でも、発音の正確さで 89.5%の1位 と報じられました(2026年9月23日時点)。 人が聞き比べる評価では、日本語 を含む主要な言語で上位に入った、ともGoogleは書いています。 ただし前の2つはGoogle側の発表なので、順位は自分の耳で確かめるのがいちばんです。
「用意された声から選ぶ」から「自分で声を作る」まで、4つの段があります。 いちばん手軽なのは①、今回いちばん新しいのは③です。
Kore(きっぱり)、Puck(元気)、Leda(若々しい)、Erinome(クリア)など、性格の説明つきの30種。まずはここから。
もっと大きな声の棚。言語や性別、声の高さ、キャラクター性で絞り込んで探せます。
「30代の、はきはきしたスポーツ実況の女性」のように説明すると、新しい声を作って保存できます。作った声はIDで何度でも呼べるので、キャラの声がぶれません。
10〜30秒の録音から、その人の声を再現します。同じ人が読んだ同意の文章の録音が必須で、他人の声を勝手に使うことはできないしくみです。
同じ声でも、指示しだいで、元気にも、ひそひそ声にも、真剣にもなります。 指示の書き場所は3つです。
「ひそひそ声で」「少し真剣に」「ゆっくり説明するように」など、そのセリフ全体の話し方。セリフ本文とは別の欄に書きます。日本語で書いても使えます(この特集の動画も日本語で指示しました)。
<laugh>(笑う)、<sigh>(ため息)、<short pause>(ひと呼吸)などを本文の中に入れます。日本語の台本でも、タグは英語のまま書くのが決まりです。
話し手を2人まで決めて、1回で会話を作れます。セリフごとにどちらが話すかを必ず書くのが3.8のルールです(プリセットの声のみ)。
英語の台本なら、強く言いたい単語を大文字で書くと強調されます。
上の動画は、プリセットの声 Erinome に、次の話し方の指示を組み合わせて作りました。 ひそひそ声や、得意げ、お別れのあいさつなど、場面ごとに指示を少しずつ足しています。
「とびきり可愛く、甘くてキラキラした声で、明るく元気に、はずむように、少し早口で」
「ひそひそ声で、内緒話のように、とびきり可愛く」——声はかなり小さくなるので、動画では音量を少し上げています。
前のモデルで作った台本やプログラムは、そのままでは期待どおりに動かないことがあります。
試すだけならブラウザで十分。自分のアプリや動画づくりに組み込むならAPIです。
音声生成のページ(aistudio.google.com/generate-speech)を開きます。Googleアカウントがあれば、無料枠で試せます。
プリセットやボイスライブラリから選ぶか、ボイスデザインで文章から声を作ります。
台本と話し方を入れて再生。気に入った声は voice_… のID をコピーすれば、APIからも同じ声で呼べます。
Gemini API のキーを AI Studio で発行し、読み上げる文章、話し方(style)、声の名前(または voice_… のID) を送るだけです。 返ってきた音声は base64 という文字の形なので、元に戻して .wav として保存します。
$ export GEMINI_API_KEY="あなたのキー"curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" -H "Content-Type: application/json" \
-d '{"model":"gemini-3.8-flash-tts","input":[{"type":"user_input","content":[{"type":"text","text":"やっほー!じぇみちゃんだよ。","annotations":[{"type":"speech_metadata","style":"明るく元気に"}]}]}],"response_format":{"type":"audio"},"generation_config":{"speech_config":[{"voice":"Erinome"}]}}' \
| jq -r '[.steps[] | select(.type=="model_output") | .content[] | select(.type=="audio")] | last | .data' \
| base64 --decode > out.wav
※ 書き方は Gemini API 公式ドキュメント(ai.google.dev)にもとづく2026年9月26日時点のものです。
キーは人に見せないでください。ページやプログラムに直接書き込まず、環境変数などで渡すのが安全です。
$ pip install -U google-genaiimport base64
from google import genai
client = genai.Client()
res = client.interactions.create(
model="gemini-3.8-flash-tts",
input=[{"type": "user_input", "content": [{
"type": "text", "text": "やっほー!じぇみちゃんだよ。",
"annotations": [{"type": "speech_metadata", "style": "明るく元気に"}],
}]}],
response_format={"type": "audio"},
generation_config={"speech_config": [{"voice": "Erinome"}]},
)
with open("out.wav", "wb") as f:
f.write(base64.b64decode(res.output_audio.data))※ 3.1以前の解説記事にある generate_content + WAVヘッダーを自分で付ける書き方とは別物です。古いコードは、そのままでは使えません。
料金は「100万トークンあたり何ドル」。音声は 1秒=25トークン なので、1分の音声は1,500トークンです。 いまの値段は 2026年12月31日まで の価格で、2027年1月1日から2倍になります。
| モデル | 入力(文章) | 出力(音声) | ひとこと |
|---|---|---|---|
| 3.8 Flash TTS 表現力の看板 |
$0.50 | $9 | 1分で約1.4セント。2027年からは $1 / $18。 |
| 3.8 Flash-Lite TTS 速さと安さ |
$0.50 | $6 | 1分で約0.9セント。2027年からは $1 / $12。 |
| バッチ(まとめて処理) 急がない仕事 |
半額 | 半額 | Flash TTS なら $0.25 / $4.50。 |
| 3.1 Flash TTS 前のプレビュー版 |
$1 | $20 | 新しい 3.8 のほうが、年内はずっと安い。 |
※ 価格は Gemini API の公式料金ページにもとづく2026年9月26日時点のもので、すべて100万トークンあたり。
無料枠もありますが、無料枠で送った内容は Google のサービス改善に使われます(有料枠では使われません)。
声を選び、演技をつけ、足りなければ文章で新しい声を作る。 これまで録音スタジオと声優さんが必要だった仕事の入口が、台本を書ける人なら誰でも 立てる場所まで下りてきました。 台本さえ書ければ、声はあとからついてくる。放送部の部長は、その入口に立つための道具を、みんなに配りはじめたところです。 まずは AI Studio で、好きな声を1つ見つけるところから。