← 返回試聽咒語書

三類音樂咒語書:生成實驗報告

更新:2026-09-21T12:47:40+08:00。狀態:27/27 個渲染版本完成;作品集 15/15 首。

怎麼閱讀

開啟 index.html 可離線試聽、比較、複製prompt及記錄自己的評分。作品集包含每類五份不同的原創曲譜;控制組另保留同曲譜五個渲染條件。3首作品同時屬於兩組,總計27個渲染、15份不同創作,不能當成27首不同作曲。所有音樂以純器樂為生成目標;是否有哼唱或人聲仍待人耳覆核。

實驗設計

每類01/03用seed831001,02/04用seed20260921,分別比較精簡描述和具體配器描述;03/05同seed、同style、同ABC,只把歌詞欄 [Instrumental] 改成空字串。一次改写包含多個編曲要素,不能判定某個單一詞有效。控制組每類固定24小節;作品集另外四份曲譜同時改了旋律、和聲、速度與seed,屬題材探索。

第一次不提供ABC的City Pop自由規劃跑到150秒上限。修訂後用原創ABC控制範圍,未刪失敗。詳見 EXPERIMENT.md、DESIGN-AMENDMENT-02.md、DESIGN-AMENDMENT-03.md。未做未修訂設計的完整比較,不能據一個失敗案例估算自由規劃成功率。

已量到的事實

FLAC實測平均碼率範圍:931–1490 kbps;正式生成耗時約為音樂長度 2.39 倍。

原始解碼有滿刻度樣本的版本:city-pop-02、city-pop-03、cozy-jazz-03、hyperfocus-03、city-pop-04、cozy-jazz-04、city-pop-05、cozy-jazz-05、city-pop-song-02、city-pop-song-03、city-pop-song-04、cozy-jazz-song-02、cozy-jazz-song-03、cozy-jazz-song-04、cozy-jazz-song-05。這些版本已從同一latent重解碼,處理證據見最終母帶狀態。單純把原生clamp後音訊調小不能恢復波峰。

配對結果

類型 比較 長度差 秒 LUFS差 中段振幅範圍差 dB 頻譜重心差 Hz
city-pop city-pop-01 → city-pop-03 +1.20 -1.6 +2.54 -154
city-pop city-pop-02 → city-pop-04 -0.56 +2.5 +5.91 -203
city-pop city-pop-03 → city-pop-05 -1.72 +1.5 +0.25 +66
cozy-jazz cozy-jazz-01 → cozy-jazz-03 -0.16 -1.0 -6.61 -6
cozy-jazz cozy-jazz-02 → cozy-jazz-04 -1.68 +0.7 +4.32 -177
cozy-jazz cozy-jazz-03 → cozy-jazz-05 +0.76 -2.6 +1.74 +63
hyperfocus hyperfocus-01 → hyperfocus-03 +0.04 -4.1 +3.59 +10
hyperfocus hyperfocus-02 → hyperfocus-04 +1.80 -1.3 +0.43 -11
hyperfocus hyperfocus-03 → hyperfocus-05 -0.80 +2.5 +2.52 +30

差值一律為後者減前者。中段振幅範圍為左右聲道先取平均、去掉頭尾各5秒後的一秒RMS之P90–P10;頻譜重心也用這個單聲道平均訊號,是4096點FFT功率加權的中位數,不是人耳明亮度評分,也不能拿來證明專注效果。左右聲道的相位抵消可能影響這兩個指標;全曲立體聲LUFS與LRA另列於CSV,時間範圍與計算法不同,變化方向不必相同。每種描述只有兩個主要seed,最多談本輪方向是否一致。

本輪實測結論

以下針對本機YuE2、這三份控制曲譜、兩個主要seed與本輪設定。中段振幅與頻譜特徵採左右聲道平均的訊號,可能受相位抵消影響;全曲立體聲LUFS/LRA另列CSV,不能混用不同指標的結論。量測描述音訊特徵,沒有替音樂性、類型辨識或專注效益打分。作品集新增的十二份譜不納入提示詞配對推論。

1. 控制長度:先給可檢查的結構

自由規劃先導樣本在要求60–90秒時仍跑到150秒上限;後續27版使用24小節原創ABC,27/27沒有token截斷旗標。這27版的實際時長減去譜面名義時長,介於-3.01至+0.61秒,平均絕對偏差1.04秒。 這支持「用結構管理本輪產出長度」的工作方法,不能由一個自由規劃失敗案例推論自由作曲普遍不好。旗標沒截斷也不代表耳聽結尾一定自然。想要完整長曲時,應另外設計曲式,不把秒數文字當保證。YuE2生成文件

2. City Pop:聲音特徵變了,但沒有好聽保證

兩個seed的具體版都出現較低的功率頻譜重心、較大的中段振幅範圍。可以確定整組描述改變了聲音特徵;不能只憑這些數字稱它更溫暖、更自然或更有City Pop味。下一輪把貝斯、吉他、鼓的描述分開,一次只改一項;先以音量對齊A/B挑偏好,再確認是哪一項描述有幫助。

3. Cozy Jazz:比較兩個seed

振幅範圍的變化方向在兩個seed相反,沒有支持「詳細版穩定讓爵士更平穩」的說法。保留相同譜面、多試seed,比從一次成功就宣告固定咒語有效更可判讀。本輪也未獨立測試Rhodes對木鋼琴、刷鼓對鼓機,不能從整包描述差異歸因某個樂器。

4. Hyperfocus:比較兩個seed

具體版增加了consistent low energy、slow harmonic movement及排除fill/drop等要求,但兩個seed的中段振幅範圍都沒有縮小。因此本輪未從這個指標驗出「更平穩」。振幅起伏不等於節奏不穩,也不等於更容易分心;專注用途最後仍要用實際工作時的聆聽偏好驗收。來源中的Deep Focus範例只能提供設計維度,不能代替本機測試。

5. 歌詞留白:不是只換一個無害標記

這三組同seed配對都出現非零音訊差異;這不是證明某一寫法更好聽或更能去人聲。純器樂歌詞留白来自FL YuE2作者工作流,而本機既有流程使用[Instrumental];把它當作要試的開關,保留兩個版本。

6. 高位元深度不能補回已截平的波峰

本輪15個版本在原生回傳音訊出現滿刻度樣本;重新從同一latent解碼後,15個確有超過±1的浮點波峰。省略最後的clamp、先保留浮點再整體降增益後輸出24-bit FLAC。把重解碼結果重新clamp後,與原始音訊最大逐樣本差異為0,符合預設2e-5門檻。這驗證處理用的是同一段聲音,不是重抽另一首。 原生音檔、曲譜、token和hash不動,處理前母帶與量測另外備份。最終表格使用處理後的母帶重新量測。此步改善輸出波峰保留,沒有改善作曲或演奏,也不是聽感優勝的證據。詳見MASTERING-NOTE.md與unclipped-mastering.json。

7. 生成前先驗ABC方言

Dm9與Cmaj9等標記不能直接送進本輪的原生方言parser。施工稿已保留,正式譜改用可支援的七和弦核心;九音配器留在style中請求,但不保證會被實現。普通樂譜語法有效,不代表生成器的方言就支援。官方ABC說明

下一輪最有用的做法

  1. 先挑一份旋律與和聲有潛力的譜,再用相同seed比較少量明確的配器變化。不要同時換譜、換速度、換seed後,把差異全算到prompt身上。
  2. 以三個樂器角色作起點:主旋律、低音、節奏。用「短句後留空拍」「低音在空拍回應」等可試聽的行為,取代只堆氛圍形容詞;這是下一輪設計建議,不是本輪已證明的單詞效果。
  3. 同一寫法至少保留數個seed。這次只有兩個主要seed,已能看到爵士方向翻轉;仍不足以估算普遍成功率。
  4. 比較前對齊音量,聽到有趣段落再看參數。音色自然度、節奏機械感、旋律是否陳套與結尾是否合理,各自記錄時間點。不要讓FLAC碼率代替音樂性評分。
  5. 原始latent、prompt與失敗記錄一起存。這次能從截平輸出找回波峰,靠的是latent還在;只有MP3就沒有同樣的重解碼路徑。
  6. 有人聲疑慮時聽整首。Whisper只輔助定位可辨詞句,會漏掉哼唱或scat,也會在音樂上產生幻覺。它不能把「no vocals」變成驗收保證。

本輪尚未有人耳評分,故沒有宣稱最佳版本、無人聲通過率、音樂性排名或專注效果。ASR-REVIEW.md列出轉錄線索,index.html保留空白個人試聽筆記。

人聲覆核優先項目

hyperfocus-05(lyrics留白)的0–65秒窗出現多段連續英文轉錄;同seed、同譜、同style的hyperfocus-03未出現相同詞句。這是回聽優先線索,尚不能僅憑ASR確認有人聲,也不能由一組配對估算留白更容易出人聲的機率。這首保留在控制組,沒有列入十五首作品集。

聽感驗收界線

本機ASR完成 27/27 首;陽性對照與逐段原始結果放 asr/。本報告不把轉錄當人聲偵測,也沒有外傳音檔做模型評分。 此工具環境未直接完成可靠的人耳聆聽,故旋律品質、爵士感、耐聽性、人聲有無與「最佳版本」不造分數。HTML提供空白評分卡,儲存在這台瀏覽器,可匯出JSON;匯出後才能形成自己的偏好資料。

重現與發布

每首prompt在 prompts/,曲譜在 scores/,完整有效設定、模型與權重hash在 runs/<id>/config.json 和 result.json。讀 REPRODUCE.md 再執行;腳本拒絕覆蓋既有未完成run。模型檔不包含在交付中。 來源與授權分别看 SOURCES.md、USE-AND-LICENSE.md。YouTube的AI揭露、頻道營利、Content ID是不同規範;有模型產出許可不等於自動滿足平台條件。此分享版已公開供所有人瀏覽;未上傳YouTube或申請Content ID。

ASR逐曲轉錄線索見 ASR-REVIEW.md;同一latent重解碼證據見 MASTERING-NOTE.md 與 unclipped-mastering.json。

最終母帶狀態

上面的原始滿刻度清單描述YuE2原生回傳檔;其中15個正式版本已從同一latent重解碼並重新量測。最終交付FLAC使用處理後母帶,原生audio.flac保留在原始資料包作證。未對原生程式做修改。

詳細階段耗時見 TIME-REPORT.md。NAS驗證完成時間與整體經過時間另存 私人交付收據。