文字起こしの精度を爆発的に高めた最大の原動力は、基盤モデルの進化にある。OpenAIが開発したオープンソースの音声認識モデル「Whisper」の登場は、業界の前提を根底から覆した。専門用語や雑音の混じる劣悪な音声環境であっても、人間の耳を上回る精度で音声を識別するテクノロジーは、一気に実用化のレベルを押し上げた。
さらに最高経営責任者(CEO)のSam Altman氏率いる同社が投入した「GPT-4o」は、テキスト処理のみならず音声データのリアルタイム分析において圧倒的な処理速度を誇る。文脈把握の能力が飛躍的に向上したことで、発言者の意図を組んだ要約や、会議中の決定事項の可視化がミリ秒単位で可能となった。