【Azure】Speech Servicesの機能と料金について
最終更新日:2026年8月7日
はじめに
| 項目 | Microsoft Azure | AWS | Google Cloud |
|---|---|---|---|
| シェア(国内) | 約30% | 約35% | 約15% |
| 強み | Microsoft製品連携 | サービス数・実績 | データ分析・AI |
| 無料枠 | 12ヶ月無料 | 12ヶ月無料 | 常時無料枠あり |
| 主な資格 | AZ-900 / AZ-104 | CLF / SAA | ACE / PCA |
皆様は「Siri」や「Googleアシスタント」などを普段から利用するでしょうか。筆者は天気や簡単な調べものをする際によく使いますが、認識精度の高さには感嘆しています。本稿ではそんな音声認識を行うためのサービス「Speech Services」について紹介していきます。
要注意:「Speech Services」は、その後「Azure Cognitive Services(現Azure AI services)」の一部、続いて「Azure AI Speech」へと改称され、現在は「Azure Speech in Foundry Tools」という名称に再編されています。機能自体は概ね引き継がれていますが、ブランド名・提供元カテゴリが変わっているため、実際に導入を検討する際は現行の公式ページで最新の名称・仕様をご確認ください。
この記事でわかること
Speech Servicesの機能
Speech ServicesはMicrosoft社が提供するAzureのサービスの一部であり、今回は主な4つの機能について紹介していきます。
Speech to Text
読み上げられた音声を正確に認識し、テキストデータに変換することのできる音声サービス機能になります。多数の言語に対応しており、モデルをカスタマイズすることで専門分野の固有の用語に対しても精度を高めることができます。詳しくはAzure公式サイトのSpeech関連ページで最新の機能・デモをご確認ください。
Text to Speech
Speech to Textとは逆にテキストデータから音声に変換することのできる機能になります。多数の言語・声のバリエーションに対応しており、細かい抑揚もカスタマイズすることで発声することができます。
Speech Translation
音声をリアルタイムで翻訳することのできるサービス機能になります。多数の言語間での翻訳に対応しています。
Speaker Recognition
話し手を認識して識別するサービス機能になります。グループで会話をしていても音声データから個々を識別することができます。
Speech Servicesの料金一覧
要最新確認:以下の料金は本記事作成時点の目安であり、サービス名称の変更にあわせて料金体系・単価も改定されている可能性があります。実際の料金は必ずAzure公式サイトの料金計算ツールまたは最新の価格ページでご確認ください。
| インスタンス | カテゴリ | 機能 | 料金(記事作成時点の目安) |
|---|---|---|---|
| Free – Web/コンテナー1個の同時要求 | Speech to Text | スタンダード | 1か月あたり5音声時間は無料 |
| カスタム | 1か月あたり5音声時間は無料、エンドポイントホスティング:1か月あたり1モデルまで無料 | ||
| 会話の文字起こしのマルチオーディオ | 1か月あたり5音声時間は無料 | ||
| Text to Speech | スタンダード | 1か月あたり500万文字まで無料 | |
| ニューラル | 1か月あたり50万文字まで無料 | ||
| カスタム | 1か月あたり500万文字まで無料、エンドポイントホスティング:1か月あたり1モデルまで無料 | ||
| Speech Translation | スタンダード | 1か月あたり5音声時間は無料 | |
| Speaker Recognition | 話者認証 | 1か月あたり10,000無料トランザクションまで無料 | |
| 話者識別 | 1か月あたり10,000無料トランザクションまで無料 | ||
| Standard – Web/コンテナー20個の同時要求 | Speech to Text | スタンダード | 音声時間あたり課金 |
| カスタム | 音声時間あたり課金、エンドポイントホスティング:1モデルあたり月額課金 | ||
| 会話の文字起こしのマルチオーディオ | 音声時間あたり課金 | ||
| Text to Speech | スタンダード | 文字数あたり課金 | |
| ニューラル | 文字数あたり課金(長い音声の作成は別料金) | ||
| カスタム | 文字数あたり課金、エンドポイントホスティング:1モデルあたり月額課金 | ||
| カスタムニューラル | リアルタイム合成・エンドポイントホスティング・長い音声の作成でそれぞれ別料金体系 |
この記事のポイント
- Speech Servicesには「Speech to Text」「Text to Speech」「Speech Translation」「Speaker Recognition」の4つの主要機能がある
- 無料枠が用意されており、多くの機能を登録・課金なしで試用できる
- サービス名称は「Azure Cognitive Services」→「Azure AI Speech」→「Azure Speech in Foundry Tools」と変遷しているため、導入検討時は必ず現行の公式名称・ページで最新情報を確認する
よくある質問
- Q. Speech Servicesは無料で試せますか?
- A. 各機能に無料枠が用意されており、多くの場合登録だけで一定量まで無料で試用できます。詳細な条件は公式サイトでご確認ください。
- Q. 「Speech Services」と「Azure AI Speech」は同じサービスですか?
- A. はい、同一系統のサービスがブランド名変更を経たものです。現在の正式名称は「Azure Speech in Foundry Tools」です。
- Q. 日本語には対応していますか?
- A. 音声認識・音声合成・翻訳とも日本語を含む多数の言語に対応しています。対応言語の詳細は公式ドキュメントでご確認ください。
関連記事
まとめ
本稿ではSpeech Servicesのサービスと料金について紹介してきました。Speech Servicesを上手く活用すれば簡単に音声を利用したアプリケーションを作成することができます。Speech Servicesのサービスの多くは登録なしで試用することができるので、実際に試してみて機能を体験するのが良いかと思います。
本稿が皆様のお役に立てれば幸いです。最後までお読みいただきありがとうございます。
▼ アクロビジョンについて


