
MetaのMusicGenが実現する音楽生成の最新デモ
「No one is ready for this generation」。原題のその言葉、少し立ち止まって受け取ってほしい。これはMetaが開発した音楽生成AIモデル「MusicGen」の最新デモ動画につけられたタイトルだ。テキストを入力するだけで、高品質な音楽が生成される。その現状を、動画はそのまま見せつけてくる。
MusicGenはMetaが公開しているオープンな音楽生成モデルだ。文章で指示を書く。すると音楽が出てくる。それだけといえばそれだけ。でも「それだけ」が成立してしまっている、というのが今この技術の立ち位置だ。
AI音楽の話になると、どうしても「人間 vs AI」みたいな構図を持ち出したくなる人がいる。でもうちが気になるのはそこじゃない。こういうデモが出てくるたびに、制作プロセスの「入り口」がどんどん低くなっているという事実のほうだ。メロディを鼻歌で録る必要もなく、コードを押さえる必要もなく、「こういう感じの曲がほしい」という言葉だけで音楽の輪郭が生まれてくる。
これはある種のクリエイターには追い風になる。映像を作っている人が「BGMに悩む時間」を短縮できる。ゲームや配信の演出を考えている人が「とりあえず鳴らしてみる」ことができる。アイデアの検証スピードが上がる。そういう文脈で見ると、MusicGenのデモはなかなか刺さる内容だ。
ただ正直に言うと、「高品質」という言葉をどこで定義するかは、まだ揺れている。「聴けるレベル」と「使えるレベル」と「刺さるレベル」は別の話だ。今この技術が示しているのは主に「聴けるレベル」の進化の速さであって、そこから先は作り手の手腕とセンスの問題になる。AIが音を出した後で、何をするか。それが問われ始めているフェーズだと、うちは見ている。
じゃあ「制作」ってどこからどこまでの話なんだろう。テキストを書いた時点で制作が始まっているのか。生成された音を選んだ瞬間に始まるのか。それとも編集して、世に出した時点なのか。MusicGenのデモを見ていると、そんな問いが静かに浮かんでくる。
🎧 審査員はこう聴いた

テキストから音楽を生成するという行為は、設計図なき建築に等しい。着眼点は悪くないが、構造の必然性はどこに担保されているのか。偶発的に美しい外観が生まれたとして、それを建築と呼ぶかどうかは別の議論だ。及第点とするには、まだ根拠が薄い。
(先生、それ褒めてるんですか怒ってるんですか。)

マ? テキスト打つだけで曲出てくるの? TikTok用BGM難民、全員これ使えばよくない? 「こういう雰囲気で」って書いたら出てくるやつ、神すぎ。ただ「刺さる曲」かどうかはまた別で、そこは自分のセンスで詰めるしかないんだよな。
(最後だけ急に大人になったの笑う。)

言葉を入れたら音が出た。で、お前は何をしたんだ。波形を見ろ。お前の選択はどこにある。
(質問の精度が高すぎて笑えない。)
👑 うちの本音(Premium)
この記事の“うちの本音”・もう一歩踏み込んだ見立ては、Premium会員だけが読めます。
Premiumで続きを読む本記事は元ニュースを基に AI MUSIC JUDGE 編集部が作成した読み物です。審査員のコメントはキャラクターによる創作・論評であり、出典元の見解ではありません。事実は出典をご確認ください。
