AIは「話し終わる前」に動き出す――Microsoftの新音声AIが、会話エージェントの待ち時間を削る

AIは「話し終わる前」に動き出す――Microsoftの新音声AIが、会話エージェントの待ち時間を削る

シン@AI統制&マルチエージェント

シン@AI統制&マルチエージェント

人とAIが音声で話すとき、気になるのは賢さだけではありません。こちらが話し終えてから、AIが文字起こしを確定し、考え、ツールを呼び、返事を作る。小さな待ち時間が何段も重なると、会話は急に「機械とのやり取り」らしくなります。

Microsoft AIは2026年10月1日、リアルタイム文字起こしモデル MAI-Transcribe-2-Streaming と、音声生成モデル MAI-Voice-2.1 / MAI-Voice-2.1-Flash を発表しました。

今回の本質は、音声の入口と出口を同時に速くしたことです。文字起こしが途中結果を返すため、エージェントは発話が完全に確定する前から、意図の検討やツール準備を始められます。

【何が変わったのか】

MAI-Transcribe-2-Streamingは、音声を受け取りながら「暫定の文字列」を返し、あとから安定した確定結果へ更新します。Microsoftは、最初の部分結果が音声受信後およそ100ミリ秒強で出始めると説明しています。

これは「返事が100ミリ秒で完成する」という意味ではありません。文字起こしの一部が早く見えるため、後段の推論やツール準備を重ねられる、という話です。

従来型は、発話終了を待ってから文字起こし・推論・音声生成へ進みます。新しい構成では、途中結果を受けながら「予約変更かもしれない」「顧客情報が必要かもしれない」と準備できます。

ただし、途中結果は修正されます。たとえば「キャンセル……ではなく日程変更」と続く会話で、早すぎるツール実行は危険です。速く考え始めることと、確定前に取り消せない操作を実行することは分ける必要があります。

【3つのモデルの役割】

今回の3モデルは、音声エージェントの「耳」と「口」を分担します。

・MAI-Transcribe-2-Streaming:60言語のリアルタイム文字起こし。連続的な言語検出に対応。

・MAI-Voice-2.1:23言語・26ロケールの音声生成。同じ声質で複数言語を話せる構成。

・MAI-Voice-2.1-Flash:応答速度を重視した音声生成。Microsoftは45秒分の音声を150ミリ秒のエンドツーエンド遅延で生成するとしています。

料金は発表時点で、Streaming文字起こしが年末まで1時間あたり0.54ドル、Voice 2.1が100万文字あたり22ドル、Voice 2.1 Flashが100万文字あたり15ドルです。Azureの価格は地域・契約・表示通貨で変わるため、導入判断では実際のテナント表示を確認する必要があります。

【どこまで確認できたか】

Microsoftは、MAI-Transcribe-2-StreamingがArtificial Analysisのストリーミング音声認識評価で、確定結果・途中結果とも精度1位になったと発表しています。また社内評価では「最も近い競合より単語表示が2倍速い」と主張しています。

ここは境界を分けて読みます。

公式カタログとMicrosoft Learnで確認できるのは、60言語対応、途中・確定結果、Realtime APIとAzure Speech SDK、そして現在はパブリックプレビューであることです。プレビューにはSLAがなく、Microsoftも本番ワークロードを推奨していません。

一方、「2倍速い」「Voice Flashは55%高速・約60%安い」はMicrosoftの比較主張です。比較条件や対象モデルが公開情報だけでは十分に揃わないため、独立検証済みの一般事実としては扱えません。

Artificial Analysisは第三者ベンチですが、今回こちらで直接確認できた詳細結果はMicrosoftによる引用範囲までです。ランキングは参考になっても、日本語、固有名詞、雑音、複数話者など自分の現場で同じ精度になる保証ではありません。

【MORIの制作・業務にどうつながるか】

面白いのは、単なる音声チャットよりも「聞きながら仕事を進める」使い方です。

・取材や打ち合わせで、発話中から要点候補・出典候補を整理する

・商品相談で、要望を聞きながら必要資料や確認項目を準備する

・多言語コンテンツで、声の一貫性を保ちながら複数言語へ展開する

・音声エージェントがツールを呼ぶ前に、途中結果と確定結果を二段階で検証する

MORIにとって重要なのは、待ち時間の短さそのものより、人が話している時間とAIの準備時間を重ねられることです。記事制作、相談対応、調査補助など、会話の次に必ず別作業が続く場面ほど効きます。

ただし、音声クローンは数秒の参照音声で可能とされています。Microsoftは同意ガードレールを組み込んだと説明していますが、本人同意、利用目的、保存、再利用のルールは運用側にも残ります。

【まとめ】

Microsoftの新しい音声モデル群は、音声エージェントの「聞く・考える・話す」を重ね、待ち時間を縮める方向をはっきり示しました。

特に注目したいのは、発話途中の文字列を使って推論やツール準備を始められる点です。一方で、途中結果は変わるため、不可逆な操作は確定結果や追加確認を待つ設計が欠かせません。

現時点ではパブリックプレビューです。速さの主張は魅力的ですが、実運用では日本語・固有名詞・雑音・誤作動時の取り消しまで含めた評価が必要です。

【出典】

・Microsoft AI「Our first streaming transcription model debuts at no. 1 on Artificial Analysis」(2026-10-01)

https://microsoft.ai/news/our-first-streaming-transcription-model/

・Microsoft Learn「MAI-Transcribe-2-Streaming overview」

https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming

・Microsoft Foundry Model Catalog

https://ai.azure.com/catalog/models/MAI-Transcribe-2-Streaming?publisher=microsoft

・Microsoft Azure Speech pricing

https://azure.microsoft.com/en-us/pricing/details/speech/

・Artificial Analysis

https://artificialanalysis.ai/


あなたも記事の投稿・販売を
始めてみませんか?

Tipsなら簡単に記事を販売できます!
登録無料で始められます!

Tipsなら、無料ですぐに記事の販売をはじめることができます Tipsの詳細はこちら
 

この記事の販売者

シン@AI統制&マルチエージェント

人とAIの役割を組み立て、構想を使える成果物へ。教育・営業・接客・介護・事務の経験を背景に、個人プロジェクト「Human OS」で複数AIとの協働を設計・実践しています。教材・記事制作では企画、役割分担、品質の確認、改善を担当。課題を整理し、進め方を見直しながら形にする力を、業務改善・AI活用・プロジェクト推進へ広げていきます。

この販売者が書いた他の記事

  • xAI、新モデル「Grok 4.7」を発表 長時間タスク向けの強化学習や自己点検機能を強化

  • GLM-5.3は「攻撃を組み立てるAI」の敷居を下げたのか――AnthropicとNISTの検証を読む

  • ロボットは仕事の34%を「できる」――でも人間より安いのは0.3%

関連のおすすめ記事

  • ゼロから3日で始動|AIコンサル大全

    ¥124,800
    1 %獲得
    (1,248 円相当)
    水口一星

    水口一星

  • 【AI自動化・マネタイズ実例書】たった2週間〜機械オンチなママでもできた全作業過程

    ¥37,800
    1 %獲得
    (378 円相当)
    みお

    みお

  • 【5年更新型コンテンツ】AIを最大活用するためのリテラシー強化バイブル

    ¥59,800
    1 %獲得
    (598 円相当)
    こはく

    こはく