MiniMax-Music3 本機音樂咒語書
更新:2026-09-22T10:47:03.303756+08:00。音樂由AI生成,模型標示:MiniMax-Music3。
已完成27個60秒預算的生成版本,作品集三類各5首,共15個take;選集總長12.86分鐘。實際全體長度介於29.84與59.92秒。生成累計381.00分鐘,不含ASR與轉檔。
本輪可以支持的結論
- 本機audio.cpp/Metal搭配現有量化權重可完成這批輸出,不能由此代表官方CUDA完整精度模型的品質。
- 15首選集有不同提示方向與seed,未用曲譜控制;不能宣稱15份曲譜或已人工確認旋律相異。
- 有15/27版本距60秒預算不到1秒。接近預算是需回聽收尾的線索,不能判定「自然完成」。沒有自動淡出掩蓋收尾。
- 有0/27原生輸出出現滿刻度樣本;詳見量測CSV。執行器上游clamp不能靠後製降音量復原。
- 所有正式版本均已做全檔解碼與本機分段ASR。ASR非人聲偵測,器樂、音樂性、耐聽度與自然收尾仍未人工驗收。
配對量測:後者減前者
| 類型 | 版本 | 長度秒 | LUFS | 中段RMS範圍dB | 頻譜重心Hz |
|---|---|---|---|---|---|
| city-pop | 01→03 | +29.16 | -6.0 | +21.22 | -824 |
| city-pop | 02→04 | -24.13 | +2.7 | +13.28 | -348 |
| city-pop | 03→05 | -0.21 | +2.5 | -1.81 | +454 |
| cozy-jazz | 01→03 | +30.08 | +0.1 | +26.21 | +370 |
| cozy-jazz | 02→04 | +28.89 | -4.0 | -1.90 | +166 |
| cozy-jazz | 03→05 | +0.00 | -17.8 | -18.79 | -501 |
| hyperfocus | 01→03 | +0.00 | +3.8 | -22.14 | +745 |
| hyperfocus | 02→04 | +0.00 | +2.8 | -21.34 | -28 |
| hyperfocus | 03→05 | +0.00 | +1.4 | +13.46 | -392 |
01→03及02→04比較精簡與結構式caption,03→05只變更器樂段落標籤。兩個seed不夠支持統計顯著或通用優勝結論;頻譜與動態的方向也不等於較好聽。與YuE2的時長、精度、曲譜條件不同,只能作實務試聽比較。
下一輪可沿用的做法
先寫主奏、伴奏的職責和段落變化,再寫音色形容詞。明確指定器樂並排除哼唱、scat及vocal samples,但仍回聽。固定一組推論參數,用兩個seed比較整套caption,再抽查更換seed是否翻轉結果。不要同時改步數、guidance、旋律方向後歸因某個詞。
duration_sec為AR frame預算;要完整長曲需另測較大預算,不應把短測試直接循環冒充長曲。保留原生WAV、seed、請求與執行器版本;高碼率只保存波形,不能修復廉價音色或薄弱旋律。第一次只跑一首確定速度和記憶體,再排串行批次,避免同機多個大模型爭用Metal記憶體。
完整輸入見各首參數JSON;訊號處理、授權及來源在各自文件。沒有任何自動好聽評分或「最佳咒語」排名。
過短輸出與重試紀錄
保留4次作品集過短輸出,耗時26.84分鐘;不算入15首選集。作品集不足30秒會保留原檔、最多換seed重試三次。這是長度篩選,並非音樂性評分,亦會造成選樣偏差。
- hyperfocus-song-03:seed 20261023產生6.76秒,改用seed 20262023;提示詞與推論參數保持。
- hyperfocus-song-03:seed 20262023產生28.48秒,改用seed 20263023;提示詞與推論參數保持。
- hyperfocus-song-03:seed 20263023產生28.76秒,改用seed 20264023;提示詞與推論參數保持。
- cozy-jazz-song-04:seed 20261014產生28.43秒,改用seed 20262014;提示詞與推論參數保持。
固定seed控制組保留1個不足30秒的失敗長度案例,不能當成合格完整歌曲。控制組不偷偷改seed,避免破壞比較條件。
- cozy-jazz-01:29.84秒。
包含被排除嘗試的總生成成本:407.84分鐘。
回聽紀錄
2026-09-22,使用者回饋:「City Pop 變得超奇怪」,並認為「YuE2 還是比較適合唱歌」。這是目前收到的實際聽感回饋;尚未明確定位曲目ID、時間點或怪異的具體聲音特徵,因此不替使用者填入分數,也不假設是鼓、和聲或音色哪一項出錯。
依對話脈絡,可能指向剛分享的MiniMax City Pop樣本,未獲曲目確認。該次回聽應列為負面評價,不能因格式量測通過就當作推薦作品。作品集是實驗選集,不是品質背書。
「YuE2優先用於有主唱歌曲」記為使用者提出的後續創作方向;尚無同條件的人聲歌曲對照,不能把這個偏好寫成跨模型的普遍能力排名。現有純器樂測試繼續保留成功與失敗案例,以便比較;不因此追加未要求的有主唱生成批次。