AI音声読み上げはどこまで人の声に近いのか|MicrosoftとGoogleの公式資料で使い方を確かめる
「AI音声読み上げって、結局どれを使えばいいのでしょうか」
読み上げアプリを検索すると、名前だけが何十個も並んでいて、どれから触ればいいのか分からない、という声をよく聞きます。
先にお伝えすると、AI音声読み上げでつまずく原因のほとんどは、アプリ選びではなく「2つの入口を混ぜていること」です。
- すでに使っているアプリの中に入っている読み上げ
- 音声ファイルを作るためのクラウドのサービス
この2つは、名前が似ていても、やれることも、料金の数え方もまったく違います。
片方で足りる用事なのに、もう片方を調べ続けて時間を使ってしまう。
これがいちばん多いつまずき方です。
私はAIツールを日常的に検証している立場で、MicrosoftとGoogleの公式ドキュメントを開き直し、境目を逐語で確認しました。
確認したのは、入口・押す順番・音声の種類・課金の数え方の4つです。
この記事では、その確認結果を「触る順番」に組み直して、今日の1回から仕事で使うところまでを1本につなげます。
できることだけを並べるつもりはありません。
公式が「ここは対象外」「ここから課金」と書いている境目も、そのまま載せます。
■先にこの記事の結論
✓ AI音声読み上げには「アプリの中」と「クラウド」の2つの入口があります
✓ 聞くだけならWordの[校閲]タブの[読み上げる]で足ります
✓ 音声ファイルを作って配りたいときだけ、クラウドの音声合成が要ります
✓ クラウドの課金は「処理した文字数」で数えます。スペースも句読点も数に入ります
✓ 日本語の漢字は、課金では1文字が2文字としてカウントされます(Microsoftの公式表記)
✓ 読み方を細かく直したいときはSSMLというマークアップを使います
(PR)
AI音声読み上げは、どこから触ればいいのか
いちばん迷うところから答えます。
結論|アプリを選ぶ前に、用事を2つに分けます
AI音声読み上げで最初に必要なのは、アプリの一覧ではありません。
自分の用事が「聞きたいだけ」なのか「音声ファイルが要る」のかを、先に分けることです。
ここが決まらないまま比較記事を読むと、必要のない機能まで検討することになります。
- 自分が聞くだけ → アプリの中の読み上げで終わります
- 人に配る音声を作る → クラウドの音声合成が要ります
この2つは、そもそも別の道具として数えたほうが早く片づきます。
AI音声読み上げは「音声合成」とも呼ばれます
言葉の整理もしておきます。
Microsoftの公式ドキュメントには、テキスト読み上げ機能は音声合成とも呼ばれる、と書かれています。
- テキスト読み上げ
- 音声合成
- TTS(Text to Speech)
検索するときは、この3つが同じものを指していると考えて構いません。
呼び名が3つあるせいで、別々の技術だと思い込んで探し続けてしまう方が多いところです。
この記事は「押す順番」だけを並べます
機能の紹介は最小限にします。
順番が決まると、今日やることが1つに絞れます。
迷っている時間のほとんどは、操作の難しさではなく「どっちの入口の話をしているか決まっていないこと」から出ています。
AI音声読み上げの2つの入口|アプリの中とクラウド
まず、地図を作ります。
AI音声読み上げの入口①|すでにあるアプリの中
1つ目は、いま使っているソフトの中です。
- Wordの[校閲]タブ
- パソコンのアクセシビリティ機能
- ブラウザやスマホの読み上げ機能
追加の契約も、ファイルの書き出しも要りません。
開いている文章を、その場で音にするだけです。
AI音声読み上げの入口②|クラウドの音声合成サービス
2つ目は、音声ファイルを作るためのサービスです。
- Microsoftの音声サービス
- GoogleのCloud Text-to-Speech
Googleの公式ドキュメントには、テキストまたはSSMLの入力をMP3やLINEAR16などの音声データに変換する、と書かれています。
つまり、こちらは「ファイルが出てくる」側です。
AI音声読み上げの2つの入口の使い分け
線はここで引けます。
- 自分の耳に入れば終わり → 入口①
- 動画・教材・アナウンスに使う → 入口②
入口①には、音声ファイルとして書き出す機能はありません。ここを期待して探し続けると時間だけが減ります。
AI音声読み上げをWordで使う手順
いちばん手前から始めます。
AI音声読み上げの前に|Wordの3つの機能の違い
Wordの中には、似た名前の機能が3つあります。
- 読み上げ=文書の全部または一部を読み上げます
- Speak=選択したテキストのみを読み上げます(Windowsのみ)
- ナレーター=ダイアログボックスやボタンまで読み上げるWindowsのスクリーンリーダーです
このうち、文章を聞くために使うのは「読み上げ」です。
AI音声読み上げをWordで動かす3手
手順は3つで終わります。
- [校閲]タブで[読み上げる]を選択します
- コントロールで[再生]を選択します
- 終わるときは[停止](×)を選択します
一時停止したいときは[一時停止]を選びます。
AI音声読み上げが使えるWordのバージョン
条件が1つあります。
Microsoftの公式ヘルプには、音声読み上げ機能はOffice 2019、Office 2021、およびMicrosoft 365でのみ使用できる、と書かれています。
古いバージョンのWordでは、そもそもボタンが出てきません。
ボタンが見つからないときは、操作を探すより先にバージョンを確認したほうが早いです。
AI音声読み上げの設定を変える手順
そのままだと速すぎる、という声が多い部分です。
AI音声読み上げの速度を変える
速度は自分で決められます。
- 読み上げ速度スライダーを使って読み上げ速度を変更します
慣れるまでは遅めにして、耳が追いつくようになってから上げるのが現実的です。
AI音声読み上げの声を変える
声も選べます。
- [音声の選択]で、目的の音声を選択します
日本語の文章を読ませるなら、日本語の音声を選ぶ必要があります。
AI音声読み上げで一部だけ読ませる
全文を聞く必要がないときの手です。
- 読み上げるテキストを選択します
- [校閲]タブから読み上げを開始します
校正のために自分の文章を聞き直すなら、この「選択してから読む」がいちばん短い経路です。
AI音声読み上げをMicrosoftのクラウドで使う場合
ここからは、音声ファイルを作る側の話です。
AI音声読み上げのクラウド版でできること
公式が挙げている用途は、次のようなものです。
- チャットボットや音声アシスタントとの対話に使う
- 電子書籍などのデジタルテキストをオーディオブックに変換する
- 車内ナビゲーションシステムに使う
アプリケーション、ツール、またはデバイスで、テキストを人間に似た合成音声に変換できる、と書かれています。
AI音声読み上げのコードを書かない入口もあります
いきなり開発の話にはなりません。
公式ドキュメントには、コードを使わない方法で試すためのツールが案内されています。
- まずは画面上で音声を選んで試す
- 実装はそのあとで決める
この順番なら、開発の知識がなくても手前まで進めます。
AI音声読み上げの長い原稿はやり方が変わります
長さで扱いが分かれます。
10分を超えるテキスト読み上げファイル(たとえばオーディオブックや講義など)は、バッチ合成のAPIで非同期に合成する、と書かれています。
- 短い文章 → その場で返ってきます
- 10分を超える音声 → 依頼を出して、できあがったら受け取る形になります
「長い原稿を投げたのに返ってこない」と感じたときは、壊れているのではなく、そもそも非同期の仕組みだった、ということがあります。
AI音声読み上げの音声の種類|標準音声とカスタム音声
声の選び方にも段階があります。
AI音声読み上げの標準音声
まずは、そのまま使える声です。
公式には、100以上の言語とロケールですぐに使用できる高品質のニューラル音声、と書かれています。
- 契約して選ぶだけで使えます
- 各標準音声モデルは24kHzおよび高忠実度48kHzで利用できます
AI音声読み上げのカスタム音声
次に、自分たちの声を作る側です。
製品やブランドに固有のカスタム音声を作成できる、と書かれています。
ただし、ここには条件があります。
- 責任を持って使ってもらうためアクセスが制限されています
- 使うには申請が必要です
AI音声読み上げのカスタム音声は時間で課金されます
料金の数え方も、標準音声とは違います。
カスタム音声のトレーニングとホスティングは、どちらも時間単位で計算され、1秒あたりに課金される、と書かれています。
- プロの音声の微調整は96コンピューティング時間の上限で課金されます
- エンドポイントが現在ホストされていない場合は課金されません
「作ったまま置いておくと課金が続く」という形になりやすいので、使わない期間の扱いは先に決めておくほうが安全です。
AIをこの1件だけで終わらせたくない人へ:基礎から学べる無料のオンライン体験セミナー
AI音声読み上げをSSMLで細かく調整する
読み方を直したいときの道具です。
AI音声読み上げのSSMLとは何か
名前だけ見ると難しそうですが、役割は単純です。
音声合成マークアップ言語(SSML)は、テキスト読み上げ出力をカスタマイズするために使用されるXMLベースのマークアップ言語です。
- ピッチの調整
- 一時停止の追加
- 発音の改善
- 話す速度の変更
- 音量の調整
- 1つのドキュメントへの複数の音声の割り当て
AI音声読み上げでSSMLが必要になる場面
使いどころは、はっきりしています。
固有名詞や数字の読み方がおかしいとき、原稿の側を書き換えるのではなく、SSMLで読み方を指定します。
Googleの公式ドキュメントにも、序数が正確に発音されるように、序数であることをマークするSSML入力を渡す、という例が挙げられています。
AI音声読み上げのSSMLには対応の差があります
ここは注意点です。
音声によっては、SSMLタグが一部しかサポートされていないことがある、と書かれています。
- 一部のHD音声
- パーソナル音声
- 埋め込み音声
「同じSSMLを書いたのに声によって効かない」という現象は、書き方の間違いではなく対応の差であることがあります。
AI音声読み上げをGoogleのクラウドで使う場合
もう一方の選択肢も見ておきます。
AI音声読み上げのGoogle側の入力と出力
構造はシンプルです。
テキストまたはSSMLの入力を、MP3やLINEAR16(WAVファイルで使用されるエンコード)などの音声データに変換します。
- 入力=生のテキスト、またはSSML
- 出力=MP3やLINEAR16などの音声データ
AI音声読み上げの結果はそのままでは再生できません
ここでつまずく方がいます。
音声合成プロセスでは、生の音声データをbase64でエンコードされた文字列として生成します。
つまり、返ってくるのは音そのものではなく、文字列です。
- 返ってきた文字列を音声ファイルにデコードする
- そのうえで再生する
AI音声読み上げの声の細かい設定
声そのものも調整できます。
Googleの公式ドキュメントには、発話速度、ピッチ、音量、サンプルレート(ヘルツ単位)の構成をサポートしている、と書かれています。
音声は言語・性別・アクセント(一部の言語)によって分かれています。
同じ文章でも、英国のアクセントの女性の声と、オーストラリアのアクセントの男性の声を選び分けられます。
AI音声読み上げの声を選ぶときに見るところ
声の一覧は長いので、見る順番を決めておくと早いです。
Microsoftの公式ドキュメントには、ビジネスのニーズに合った音声を決めるための音声ギャラリーが案内されています。
- 言語とロケールが合っているか
- 用途に合う話し方か
- SSMLがどこまで効く音声か
この3つだけ見れば、候補は数個に絞れます。
全部を聞き比べようとすると、それだけで半日が消えます。
迷ったら、まず標準音声の中から1つ選んで最後まで作りきります。声の作り込みは、形になってからで間に合います。
AI音声読み上げをアプリに組み込むときの考え方
Googleの公式ドキュメントには、分かりやすい例が挙げられています。
自然言語によるフィードバックを、再生可能な音声ファイルとして提供する音声アシスタントのアプリが例として書かれています。
たとえば、カレンダーにイベントを追加したあと、アプリが「カレンダーにイベントを追加しました」という文章を作ります。
- アプリが応答の文章を作る
- その文章をAI音声読み上げで音に変える
- 利用者に音で伝える
つまりAI音声読み上げは、文章を作る工程の「あと」に置く道具です。
ここを取り違えて、AI音声読み上げに文章まで考えさせようとすると、うまくいきません。
何を言うかを決めるのは別のAIか人で、AI音声読み上げはそれを声にするだけ、という分担が現実的です。
AI音声読み上げを口形素・アバターまで広げる場合
もう1段先の話も、線だけ引いておきます。
AI音声読み上げの口形素とは何か
聞き慣れない言葉ですが、意味は単純です。
口形素は、特定の音素を生成するときの唇、顎、舌の位置など、観察されたスピーチにおける主要な姿勢のことです。
- 音声と音素に強い相関があります
- 顔のアニメーションのデータを作るために使います
読唇でのコミュニケーション、教育、エンターテインメント、カスタマーサービスでの顔の表現に使われる、と案内されています。
AI音声読み上げの口形素には言語の制限があります
ここは条件がはっきり書かれています。
口形素は現在、en-US(米国英語)のニューラル音声でのみサポートされています。
- 日本語では使えません
- 英語(米国)のニューラル音声だけが対象です
「日本語でアバターの口を合わせたい」という用事は、この機能では満たせません。
AI音声読み上げのアバターは秒で課金されます
課金の数え方も、文字数ではなくなります。
テキスト読み上げアバターは、ビデオ出力の長さに基づいて1秒ごとに料金が課金されます。
さらに、リアルタイムのアバターは数え方が違います。
- 話しているかどうかに関係なく、アバターがアクティブな時間で数えます
- 待機している時間も対象になります
つまり、開いたまま放置すると費用が積み上がる形です。
公式のサンプルコードには、待機中はローカルの動画を使う、という費用を抑えるためのヒントが案内されています。
AI音声読み上げをアバターまで広げるかの判断
判断そのものは単純にできます。
- 音だけで用が足りる → 広げません
- 顔と口の動きが要る → 検討する価値があります
多くの仕事では、音だけで足ります。先にアバターから調べ始めると、必要のない検討に時間を使うことになります。
AI音声読み上げの料金は何で決まるのか
いちばん誤解されるところです。
AI音声読み上げの課金は「文字数」で数えます
時間ではありません。
課金は、正常に処理された各要求の合計文字数に基づいています。
このカウントには、すべての文字、数字、スペース、句読点が含まれます。
- スペースも数に入ります
- タブも数に入ります
- Unicodeで定義されているすべてのコードポイントが対象です
AI音声読み上げは音が出なくても課金されることがあります
ここは知らないと驚きます。
オーディオ出力が生成されるかどうかに関係なく課金され、選択した音声言語と入力テキストの不一致が原因で音声が生成されない場合でも料金が適用される、と書かれています。
つまり、言語の選び間違いでも費用は発生します。
AI音声読み上げの日本語は2文字で数えられます
日本語を扱う人にとって、いちばん大事な1行です。
日本語で使用される漢字を含め、中国語の各文字は、課金では2文字としてカウントされます。
- ひらがな・カタカナ → 1文字
- 漢字 → 2文字として数えられます
見積もりを作るときは、原稿の文字数をそのまま使うと足りなくなることがあります。
AI音声読み上げで気をつけること
道具の話が終わったら、運用の話です。
AI音声読み上げの声は誰のものか
カスタム音声を作るときは、ここが前提になります。
公式は、カスタム音声について「責任を持って使用していただくためアクセスが制限されています」と書いています。
- 本人の許諾があるか
- 何に使うと伝えているか
この2つは、機能の説明ではなく、使う側が決めることです。
AI音声読み上げに渡す原稿の中身
もう1つ、渡す前の確認があります。
社外に出せない情報を、そのままクラウドの音声合成に渡していないかは、毎回見たほうが安全です。
線引きの考え方は、生成AIにデータ分析を任せるなら、どこで手を止めるのか にも整理してあります。
AI音声読み上げの出来上がりは必ず一度聞きます
最後は単純な話です。
- 固有名詞の読み
- 数字の読み
- 区切る位置
読み間違いはテキストの上では見つかりません。公開する前に、必ず一度は自分の耳で通して聞きます。
AI音声読み上げの使い方|7日間で慣れる順番
ここまでの内容を、実際の順番に落とします。
1日目|Wordの読み上げだけ触ります
初日は入口①だけで終わらせます。
- [校閲]タブの[読み上げる]を押す
- 速度を自分に合うところまで下げる
- 声を日本語のものに変える
ここまでで「聞くだけ」の用事は全部片づきます。
2日目から3日目|自分の文章を聞き直します
次に、使い道を1つ決めます。
- 書いたメールを送る前に読み上げさせる
- 資料の本文を選択して読み上げさせる
指示の書き方そのものは、プロンプトの書き方を、AI大手3社の公式ガイドで確かめる に分解してあります。
4日目から5日目|クラウドの音声合成を1回だけ試します
ファイルが要る用事があるときだけ、入口②へ進みます。
- コードを書かない画面で声を選ぶ
- 短い文章を1本だけ合成してみる
- 出てきた音声を聞く
最初から長い原稿を投げないほうが安全です。課金は文字数で数えるので、試す段階は短いほど軽く済みます。
6日目から7日目|SSMLで読み方を直します
最後に、仕上げの工程です。
- 読み間違えた固有名詞をSSMLで指定する
- 間の取り方を調整する
資料づくりまで広げたい場合は、生成AIに資料作成を頼むと、どこまで出来上がるのか が近い工程を扱っています。
AIエージェントの使い方|初心者でも今日から仕事で活用できる基本ガイドについてはこちら↓
「他に何ができるのか」を一度に知りたい人へ:無料のオンライン体験セミナー
AI音声読み上げによくある質問
短く答えます。
AI音声読み上げは無料で使えますか
Wordなどアプリの中の読み上げは、そのソフトを使えていれば追加の費用は案内されていません。
クラウドの音声合成は、処理した文字数に応じた課金になります。
AI音声読み上げのボタンがWordに出てきません
バージョンの条件があります。
公式には、音声読み上げ機能はOffice 2019、Office 2021、およびMicrosoft 365でのみ使用できると書かれています。
AI音声読み上げで音声ファイルは作れますか
アプリの中の読み上げでは、音声ファイルの書き出しは案内されていません。
- 聞くだけ → アプリの中で足ります
- ファイルが要る → クラウドの音声合成を使います
AI音声読み上げの読み間違いはどう直しますか
原稿を書き換えるのではなく、SSMLで指定します。
SSMLでは、発音の改善、一時停止の追加、話す速度の変更などを指定できます。
AI音声読み上げは日本語に対応していますか
対応しています。
Microsoftの標準音声は100以上の言語とロケールに対応していると書かれており、Googleの音声も言語ごとに分かれています。
AI音声読み上げの課金でスペースは数えられますか
数えられます。
- 文字・数字・スペース・句読点がすべてカウントの対象です
- 漢字は2文字としてカウントされます
AI音声読み上げで長い音声を作れますか
作れます。
10分を超える音声は、バッチ合成のAPIで非同期に合成する形になります。
AI音声読み上げと他のAIはどう使い分けますか
役割で分けるのが現実的です。
- AI音声読み上げ=書いた文章を音にする
- 他のAI=文章そのものを作る・整える
比較の考え方は、Claude CodeとClaude Coworkの違い にも書いています。
AI音声読み上げの次に|AIを仕事に組み込みたい方へ
ここまでの手順を踏めば、AI音声読み上げは動きます。
ただ、動かせるようになってから止まる方が多いのも事実です。
理由は、道具の操作と「自分の仕事のどこを渡すか」の設計が、まったく別の作業だからです。
- どの業務を任せて、どこを人が持つのか
- 社外に出せない情報をどう切り分けるのか
- 続けられる形にどう落とすのか
この部分は、機能の一覧を何回読んでも決まりません。
操作を覚えることと、仕事の切り分けを決めることは、別々の作業です。
外の人に一度整理してもらうと、この切り分けだけは短時間で片づきます。
無料の説明会は、その最初の1回に使うにはいちばん軽い入口です。
- 費用はかかりません
- 合わなければその場で終わりにできます
関連記事
- Claude Codeの使い方|AI初心者でもプログラミングが変わる活用術
- Claude Coworkの使い方|AI初心者でも今日から使いこなせる基本ガイド
- 生成AIパスポートの難易度はどのくらいか
- AIと著作権はどうなっているのか|文化庁と条文だけで整理した17の論点
- AIは何から始めればいいのか|スタートAI初心者向け順番整理
参考元・出典一覧
情報確認日
2026年8月31日(機能の提供範囲・課金の数え方・対応バージョンは2026年8月31日時点で公式ドキュメントから取得したものです)
提供機能・提供国・料金・対応バージョンは変更される可能性があります。
利用する前に、必ず公式の最新情報をご確認ください。
免責事項
本記事は筆者個人の検証と調査にもとづいて作成しています。
効果や成果には個人差があり、内容を保証するものではありません。
記事内の機能や条件は、国・言語・アカウントの種類・ソフトのバージョンによって異なる場合があり、すべての環境に当てはまるものではありません。
※本記事にはアフィリエイトリンクを含む場合があります。
サービス利用の際は、必ず公式情報をご確認のうえ、ご自身で判断してください。
この記事で扱ったのは、AIの使い道のうちの1つだけです。「他に何ができるのか」を順番に知りたい人には、無料のオンライン体験セミナーがあります。
AIを基礎から学べる無料セミナーを見てみる(オンライン・費用0円)
#AI音声読み上げ #音声合成 #テキスト読み上げ #TTS #SSML #Word #Microsoft365 #GoogleCloud #Azure #ナレーション #オーディオブック #生成AI #生成AI活用 #AIツール #AI初心者 #AI活用 #仕事効率化 #50代からのAI #学び直し #音声AI #業務効率化
いいなと思ったら応援しよう!
よろしければ応援お願いします! いただいたチップはクリエイターとしての活動費に使わせていただきます!