← 返回MiniMax試聽

MiniMax-Music3 本機音樂咒語書

更新:2026-09-22T10:47:03.303756+08:00。音樂由AI生成,模型標示:MiniMax-Music3。

已完成27個60秒預算的生成版本,作品集三類各5首,共15個take;選集總長12.86分鐘。實際全體長度介於29.84與59.92秒。生成累計381.00分鐘,不含ASR與轉檔。

本輪可以支持的結論

配對量測:後者減前者

類型 版本 長度秒 LUFS 中段RMS範圍dB 頻譜重心Hz
city-pop 01→03 +29.16 -6.0 +21.22 -824
city-pop 02→04 -24.13 +2.7 +13.28 -348
city-pop 03→05 -0.21 +2.5 -1.81 +454
cozy-jazz 01→03 +30.08 +0.1 +26.21 +370
cozy-jazz 02→04 +28.89 -4.0 -1.90 +166
cozy-jazz 03→05 +0.00 -17.8 -18.79 -501
hyperfocus 01→03 +0.00 +3.8 -22.14 +745
hyperfocus 02→04 +0.00 +2.8 -21.34 -28
hyperfocus 03→05 +0.00 +1.4 +13.46 -392

01→03及02→04比較精簡與結構式caption,03→05只變更器樂段落標籤。兩個seed不夠支持統計顯著或通用優勝結論;頻譜與動態的方向也不等於較好聽。與YuE2的時長、精度、曲譜條件不同,只能作實務試聽比較。

下一輪可沿用的做法

先寫主奏、伴奏的職責和段落變化,再寫音色形容詞。明確指定器樂並排除哼唱、scat及vocal samples,但仍回聽。固定一組推論參數,用兩個seed比較整套caption,再抽查更換seed是否翻轉結果。不要同時改步數、guidance、旋律方向後歸因某個詞。

duration_sec為AR frame預算;要完整長曲需另測較大預算,不應把短測試直接循環冒充長曲。保留原生WAV、seed、請求與執行器版本;高碼率只保存波形,不能修復廉價音色或薄弱旋律。第一次只跑一首確定速度和記憶體,再排串行批次,避免同機多個大模型爭用Metal記憶體。

完整輸入見各首參數JSON;訊號處理、授權及來源在各自文件。沒有任何自動好聽評分或「最佳咒語」排名。

過短輸出與重試紀錄

保留4次作品集過短輸出,耗時26.84分鐘;不算入15首選集。作品集不足30秒會保留原檔、最多換seed重試三次。這是長度篩選,並非音樂性評分,亦會造成選樣偏差。

固定seed控制組保留1個不足30秒的失敗長度案例,不能當成合格完整歌曲。控制組不偷偷改seed,避免破壞比較條件。

包含被排除嘗試的總生成成本:407.84分鐘。

回聽紀錄

2026-09-22,使用者回饋:「City Pop 變得超奇怪」,並認為「YuE2 還是比較適合唱歌」。這是目前收到的實際聽感回饋;尚未明確定位曲目ID、時間點或怪異的具體聲音特徵,因此不替使用者填入分數,也不假設是鼓、和聲或音色哪一項出錯。

依對話脈絡,可能指向剛分享的MiniMax City Pop樣本,未獲曲目確認。該次回聽應列為負面評價,不能因格式量測通過就當作推薦作品。作品集是實驗選集,不是品質背書。

「YuE2優先用於有主唱歌曲」記為使用者提出的後續創作方向;尚無同條件的人聲歌曲對照,不能把這個偏好寫成跨模型的普遍能力排名。現有純器樂測試繼續保留成功與失敗案例,以便比較;不因此追加未要求的有主唱生成批次。