Google は、1 つではなく 2 つの別個のエンドポイントとして出荷される音声テキスト変換モデルである Gemini 3.5 Transcribe をリリースしました。ストリーミング エンドポイントは 1 秒未満の文字起こしを提供しますが、話者のダイアライゼーションと単語の時間は低下します。
新しいモデルは、機能と価格パフォーマンスの最前線をリセットします。チームは、ローンチによって 1 ドルあたりの可能性が変わるたびに、何を構築するかを再評価します。
概要は情報提供のみを目的としてまとめられています。全文についてはソース リンクを参照してください。デモのエントリは一例です。