ネット上の掲示板やSNSでは、「自分は相当な音痴だが一発で当てられた」「適当なハミングなのに完璧に特定されて鳥肌が立った」といったGoogle鼻歌検索 精度 評判が数多く寄せられています。人間の耳では判別が難しいブレた歌声から、なぜAIは正確なタイトルを導き出せるのでしょうか。
その背景には、Google AI研究チームが開発したHum to Search 仕組みの基盤である「オーディオ・フィンガープリント(音の指紋)」技術があります。公式発表資料や技術論文によると、システムは入力された歌声をそのまま聴き取るのではなく、声質、歌唱力、声の高さ(ピッチの絶対値)、使用言語といったノイズ要素をすべて削ぎ落とします。そして、メロディの「音と音の相対的な高低差」と「時間的なリズムパターン」だけを抽出し、一本の単純な数列(デジタルシグネチャ)へと変換するのです。
世界中に存在する膨大な楽曲データも同様に数列化されてデータベースに蓄積されており、ユーザーが発声した数列とリアルタイムで照合されます。たとえキーが原曲と大きくズレていようと、全体の旋律のアップダウン比率さえ保たれていれば、AIは「同一の指紋」として照合を完了させます。これが、「歌が下手でも問題なく当たる」と評される技術的カラクリです。