litas.AI BUILDER & TECH EXPLORER

AI 音樂製作 / 本機生成 / LITAS

MiniMax Music 3 音樂創作

給孩子一首歌,也替遊戲留下片尾曲。

用 MiniMax Music 3 留下育兒日常,也替遊戲角色準備片尾曲。兩首作品直接試聽,分享本機生成的過程,以及為什麼我更建議先把需求說到位、保留第一個喜歡的版本。

現成工具應用作者:Litas完整實作紀錄
創作需求歌詞與敘事本機音樂生成版本比較
AI 情境示意:日常桌面上的耳機、筆記、遊戲控制器與嬰兒玩具,連結兩首歌曲的創作主題
AI 情境示意 · 非實拍工作環境或音樂軟體介面

THE CASE IN A MINUTE

先看重點,再看細節。

01 要解決的問題
想把育兒日常與遊戲人物的心事做成歌;反覆修改,卻容易離第一版喜歡的感覺越來越遠。
02 我的實作方式
先整理故事、聲音與編曲方向,再用本機 ComfyUI 與 MiniMax Music 3 生成,留下原始版本作為比較基準。
03 做到的成果
完成《凌晨三點的我們》與《關燈以後》兩首歌曲輸出,文內提供完整試聽與需求整理方法。

成果範圍兩首均為 AI 生成歌曲,非本人演唱。本文是個人製作心得,不代表每次生成都能精準保留旋律,也不代表遊戲已正式推出。

WORKFLOW AT A GLANCE

  1. 01確定故事
  2. 02整理演唱與編曲
  3. 03生成並保留初版
  4. 04新舊對照聆聽

現成模型應用與個人創作紀錄|歌曲由 MiniMax-Music3 生成,非本人演唱或孩子聲音錄音|封面為 AI 主題示意圖

完整故事MiniMax Music 3 實作:給孩子一首歌,也替遊戲留下片尾曲

用 AI 做歌之後,我最想提醒自己的,不是再學幾個音樂名詞,而是:第一版先留好。

這次做下來,我反而常常比較喜歡一開始的版本。後面不是沒有想法,也不是隨便改;正因為聽到了可以更好的地方,才會想多要求一點。可是改著改著,某個細節可能更接近了,整首歌卻離原本喜歡的感覺越來越遠。

這篇放兩首實際作品。一首是寫給小朋友的《凌晨三點的我們》,另一首是為遊戲準備的《關燈以後》。前者想留下我們正在經歷的生活,後者想替角色的故事收尾。兩首歌的用途不同,也讓我更清楚:AI 可以負責生成音樂,但「這首歌為什麼存在」,得先由我想清楚。

如果只想先聽成果,可以直接跳到兩首歌的試聽;想少走一點修改的彎路,可以看我現在會怎麼準備第一份需求

先聽兩首歌:同一個工具,兩種不同的目的

《凌晨三點的我們》:小朋友的第一首歌

《凌晨三點的我們》|約 2 分鐘|MiniMax-Music3 AI 生成歌曲,非本人演唱或孩子聲音錄音。開啟音檔 · 試聽《凌晨三點的我們》第一版

我放的是最初的兩分鐘版本,不是後來縮短的六十秒版本。它的起點很具體:凌晨還醒著、餵奶、拍嗝,兩個人輪流接手。這些每天重複的事情,當下很累,卻也是我想留下來的生活。

聽這首時,可以留意歌詞中的日常,和音樂打算承接的情緒是否在同一個方向。它不是一首「給所有父母都適用」的勵志歌;對我來說,先有我們這段日子,才有這首歌。

《關燈以後》:為遊戲角色準備的片尾曲

《關燈以後》|約 4 分 12 秒|MiniMax-Music3 AI 生成歌曲;本頁分享音樂製作成果,不代表遊戲已正式推出。開啟音檔 · 試聽遊戲歌曲《關燈以後》

另一首的出發點,是我開發中的遊戲 MassageLive。歌曲以雨柔回望自己的人生為視角:從害怕,到看懂別人的意圖,再到能決定誰靠近、誰離開;可是掌握了主導權,並不代表她就能放心相信愛。

這裡值得聽的,不只是副歌好不好記。更重要的是,聲音與編曲有沒有陪著這個人物走到最後,而不是把她的故事唱成一首不相干的熱鬧情歌。這也是當時寫需求時,我花力氣限制演唱方式的原因。

兩首都由 MiniMax Music 3 生成歌聲與音樂。生活背景、遊戲設定與想表達的方向來自我,文字與製作需求則透過 AI 協作整理;不是我親自演唱,也不是小朋友的聲音克隆。

我想留下的不是兒歌,而是成為父母的這段日子

《凌晨三點的我們》很容易因為題材被想成一首可愛兒歌,但我當時的需求恰好不是那樣。

我想要溫暖、稍微輕快,有一點生活裡的手忙腳亂,卻不要甜到像廣告。歌裡可以有疲倦,也可以有兩個人互相接班的默契;不是把辛苦全部擦掉,再用很隆重的音樂告訴你「一切都很幸福」。

所以當時給音樂的方向,是帶木吉他色彩的華語流行:親近、自然的成人主唱,主歌像把話說給彼此聽,副歌再稍微打開。編曲以吉他、鋼琴、輕柔的節奏為主;最後才增加一點層次,不要從第一秒就堆滿弦樂,也不要突然變成高亢的抒情大歌。

這些描述說的是創作目標,不是每一項都已被模型完美執行。但把目標寫到這麼具體,至少讓「溫暖」不再只是一個每個人都能有不同理解的形容詞。

我也不需要它替我們發明一個更戲劇化的故事。凌晨的燈、孩子在懷裡、你累了換我來,已經足夠。對這首歌而言,辨認得出自己的生活,比聽起來很像一首大製作更重要。

同樣的生活背景,也出現在我做的餵奶、換尿布提醒與音箱看板。那篇是想少漏記一個時間,這首則是想多留下一段記憶。AI 在這兩件事裡扮演的角色很不一樣,但都不是為了展示功能才硬找一個用途。

遊戲歌曲的難題:不是悲傷就好,而是要像那個人

做《關燈以後》時,「寫一首悲傷的女聲情歌」其實遠遠不夠。

雨柔不是單純受傷,也不是一路變得勇敢,最後得到一個漂亮的大團圓。她越來越能看懂別人,越來越能保護自己,代價卻是很難再相信有人會真心留下。這種矛盾,才是歌曲要承接的東西。

因此,製作需求裡除了歌詞,還有很明確的聲音方向:成熟的成人女聲、溫暖而稍低的音色、自然的台灣華語,情緒要克制。不是少女感,不是撒嬌,也不是靠哭腔和高音把悲傷放大。

同一句「有情緒」,可以導向完全不同的歌

主歌裡的脆弱,和第二段取得主導權後的沉穩,是兩種表演。我的需求不是「第二段更大聲」,而是讓她更穩、更知道自己在說什麼。副歌可以打開,卻不要變成吶喊;最後可以增加弦樂,卻不想用升調把結尾推成勝利。

配器也得服從這個方向。當時寫進需求的是柔軟的鋼琴、乾淨的電吉他、低調的鼓與貝斯,橋段收回到比較稀疏的聲音,讓人物的話留在前面。不是因為樂器越少越高級,而是這個故事不需要每一秒都有人替它加重語氣。

這讓我更確定,遊戲歌曲不能只單獨拿出來問好不好聽,還得問:放回角色身上,她會不會認得這首歌?

目前放在這裡的,是音樂製作中的一首完整輸出。能聽到歌曲,和整個遊戲已經完成,是兩件事。我分享這首,是因為它能具體說明我怎麼把角色設定轉成音樂需求。

最實際的心得:一開始的比較好,越改反而越偏

如果要把這次心得濃縮成一句話,我會說:盡量在第一次就把想要的描述到位,不要把所有期待都押在後面慢慢修。

這不是說第一版必然最好,也不是說 MiniMax 修改一定會變差。這是我這輪使用最強烈的感受:原本吸引我的整體感覺,未必會在下一次生成時一起留下來。

修改文字時,我可以只換一句話,其他段落原封不動。可是在我這次使用的文字與歌詞生成流程裡,重新下需求得到的是另一次演繹,不能把它當成「只修這一個字,旋律和其他地方都保證不動」。如果我帶著修文章的期待去修歌,就很容易失望。

更麻煩的是,要求本身也可能互相拉扯。想更克制,又想更有爆發力;想像家裡輕聲說話,又想要很大的電影感。如果沒有先排出優先順序,後面每補一句,都可能讓歌曲往另一個方向走。

所以我現在會把第一個喜歡的版本當成比較基準,不覆蓋它。新的版本不是因為編號比較大,就自動比舊的好。每次回來聽,都要重新問:原本最打動我的地方還在嗎?

需求要到位,不是把提示詞塞到最長

「一開始講得越完整越好」是我的建議,但完整不等於想到什麼形容詞都往裡放。

我現在會先整理以下六件事。它們不是必填考卷,而是讓自己在生成前,先做完幾個重要的選擇。

先確定的事育兒歌曲的例子遊戲歌曲的例子
這首歌為誰存在留下兩個人照顧孩子的日常承接雨柔走過的故事
誰在說話自然、親近的成人主唱回望人生的成熟成人女聲
最重要的情緒疲倦裡仍然有互相接手的溫暖看懂人心後的克制與疏離
音樂怎麼發展主歌輕,副歌打開,收尾安靜前段脆弱,後段沉穩,不唱成勝利
哪些聲音幫得上忙吉他、鋼琴、輕柔節奏鋼琴、乾淨電吉他、克制的弦樂
最不想走到哪裡過甜兒歌、煽情大合唱少女撒嬌、吼唱、華麗大團圓

這也和官方的輸入方式接得起來。MiniMax Music 3 接受音樂描述與歌詞;官方介紹特別強調,把情緒、樂器與演唱在歌曲中的變化寫清楚,而不只給整首歌一個曲風標籤。MiniMax 官方模型介紹

不懂音樂術語,也可以先把人話說完整

不確定 BPM、調性或樂器名稱,沒有關係。我不會建議為了讓提示詞看起來專業,就填上自己也不知道為什麼要選的數字。

可以先告訴 AI:「這是疲倦但互相照顧的兩個人,不要唱得像勵志廣告。」或者:「她已經能保護自己,但不是走出一切的勝利者,結尾不要太亮。」再請 AI 協助轉成音樂描述,並逐項確認,翻譯後有沒有偷換掉原本的意思。

下面是依這次經驗整理的需求範例,不是上面音檔的逐字原始提示詞,也不是貼上就會得到相同旋律的保證。

我要一首約兩分鐘的華語歌曲,記錄新手父母半夜輪流照顧孩子的生活。核心是疲倦裡的互相接手,不是歌頌犧牲,也不要寫成兒歌。主唱自然、親近,主歌像在說話,副歌稍微打開,但不要吼唱。以木吉他、鋼琴和輕柔節奏為主,最後安靜收回來。請先檢查描述有沒有互相矛盾,再整理成音樂風格、聲音表現與編曲發展;歌詞另外列出,不要把製作說明混進要唱的內容。

如果連故事還沒想清楚,我會先用Grill Me 的追問方式整理自己:這首最想留住哪個畫面?哪句話是只有我們才會說的?少了什麼,它就變成任何人都能用的一首歌?這些答案比多加十個「溫暖、感動、療癒」有用。

我怎麼在自己的電腦做:ComfyUI 是工作台,MiniMax 負責生成

這次使用的是 Windows 上的本機 ComfyUI,搭配 MiniMax Music 3 模型。它屬於現成模型的應用,不是我自行開發音樂模型,也不是把普通配音工具叫來唱歌。

簡單理解,ComfyUI 是把步驟接起來的工作台:載入模型,把音樂描述與歌詞送入生成流程,再把結果存成音檔。官方也提供 MiniMax Music 3 工作流程範本,音樂描述可分成整體風格、演唱細節與編曲三部分,歌詞另外用主歌、副歌等段落標籤組織。ComfyUI 官方教學

對我有價值的是,需求、工作流程與生成檔案都能留在自己的電腦裡。這裡使用的本機生成流程沒有把家庭錄音送去雲端;上面聽到的人聲,是模型產生的歌聲。

可以本機跑,不代表沒有成本

我的電腦使用 RTX 4060、8GB 顯示記憶體。這次留下了實際歌曲,但過程也有生成中斷與記憶體不足的狀況;遊戲歌曲的另一個方向,當時就沒有成功輸出。

所以我不會把這篇寫成「這張顯示卡可以輕鬆、穩定做完所有歌」的推薦。模型檔案、顯示記憶體、系統記憶體和等待時間,都是本機製作的一部分。想做長歌曲,尤其不能把短片段能跑完,直接當成長版也一定沒問題。

這件事也讓保留版本更重要。好不容易得到一個喜歡的結果,我更不想為了追求一點細節,最後連原本可以用的版本都找不回來。

下一次,我會這樣安排生成與修改

第一步不是按生成,而是先定稿「這首歌要說什麼」。歌詞、角色、使用場景與最重要的情緒先對齊;不能只說要感動,卻不知道要感動誰、為了哪件事。

第二步是留住第一個喜歡的版本,連同當時的需求與工作流程一起保存。不要只剩音檔,忘了它是怎麼做出來的;也不要用同一個檔名把它蓋掉。

第三步才是決定要不要改。下一次我會盡量一次只動一個方向,例如先處理咬字,或先處理人聲表現,而不是同時換曲風、情緒、樂器和段落。這是我接下來會採用的比較方式,不是已經用實驗證明能消除所有偏移。

第四步是把新舊版本放在一起聽。新的版本有沒有解決問題?解決之後,有沒有失去原本更重要的部分?如果只是變得更複雜,卻不再像那段生活、那個人物,我寧可回到舊版。

最後,要接受停止修改也是一個選擇。對我而言,完成不是把每個形容詞都實現,而是這首歌已經足以表達我原本想說的話。

哪些人會覺得有用,以及發布前還要想的事

如果你有一段想記錄的生活、一個想表達的角色,或一支需要音樂的作品,這類工具值得研究。它讓「我想為這件事做一首歌」不再只能停在想像,但也會把創作者的功課留給你:選擇、聆聽,以及知道什麼時候不要再改。

相反地,如果期待每次都精準保留同一個歌手、同一段旋律,只改指定的一個字,就要先確認選用工具實際提供哪些編輯能力。本文分享的本機生成流程,不能被當成這些精準修改能力的承諾。

準備公開使用時,我也會把模型授權和素材權利分開看。MiniMax Music 3 使用自己的社群授權,並非一句「可以下載」就等於沒有條件;是否符合使用條款,以及歌詞、參考音訊與聲音是否有權使用,都需要分別確認。本頁清楚標示兩首為 AI 生成,並不代表聽眾因此取得任意重製或商用的授權。MiniMax-Music3 官方授權

如果下一步是把歌放進影片,我會把它當成另一個製作階段:音樂確定後,再安排畫面、節奏和字幕。需要旁白時,可接著看本機聲音克隆的經驗;畫面如何跟著聲音走,則整理在HyperFrames 影片製作篇。做出歌,不等於影片會自動完成。

回頭看這兩首,我最喜歡的仍然是它們各自有一個不能互換的理由。一首來自凌晨還沒睡的我們,一首來自一個角色不容易說出口的心事。

MiniMax Music 3 讓這些想法有機會被聽見。至於怎麼讓它不要在反覆生成裡走遠,我目前最實際的答案,還是把第一份需求說到位,並且好好保留第一個讓自己想再聽一次的版本。

LET’S MAKE IT USEFUL

你有一個想法。
我們先找到值得做的那一步。

AI 工作流、應用原型,或一篇真正說清楚產品價值的內容。從具體問題、使用情境與限制開始聊。

討論合作方向