四个 AI 代理协作,将你的音频变成完整的音乐视频 — 你选择瞬间与方向,Tunee 处理其余的一切。




从 AI 生成的音乐视频中抽出的单张画面 — 一窥 Tunee 从你的音频生成的 Lyrics to MV 视觉风格,无需摄影机或拍摄团队。



词曲创作者早就明白这一点——一首好歌词在成为歌之前就已经完成了分镜。「我开着一辆没有名字的车穿越沙漠」是一个宽景。「她缓缓转过身」是一个带有转身动作的中景。那些在抽象背景上飘浮文字的歌词视频,忽视了一个事实:每一行歌词已经是一条视觉指令。一个歌词转 MV 的流程应该读懂这些指令,而不是把文字粘贴在渐变背景上了事。
粘贴带有大致时间戳的歌词(或者直接给出完整文本——Tunee 会自动将其对齐到音频),Sage 会将每一行映射到对应的镜头。具体的名词成为建立环境的视觉,行动动词成为摄像机的运动,反复出现的副歌行复用同一个主视觉,让副歌在视觉上同样读出「副歌感」。如果你想要屏幕上的文字,依然可以要求——但那些文字会存在于一个场景之内,而不是悬浮在场景之上。
不要把歌词改写成另一个提示词。歌词本身已经够具体了;提示词应该是围绕歌词的美学框架。试试这个方法:把歌词填入歌词栏,然后用一行提示词描述世界观(「1970 年代的东京,雨夜,水坑里的霓虹倒影」),一行描述摄影风格(「手持,35mm,浅景深」),一行描述人物(「三十多岁,皮夹克,从不正面示人」)。逐行的切镜交给 Tunee 来处理,视觉风格的把控权留给你。
每个提示词都专为 Lyrics to MV 美学设计。粘贴到 Tunee,点击生成 — 你的 Lyrics to MV 音乐视频几秒内完成。
每句歌词都变成独立场景 — Tunee 的 AI 为每一行匹配 lyric text input 视觉。段落间 narrative 过渡(主歌处溶接,副歌处硬切)。结尾镜头呼应开场。为叙事紧凑的音乐视频而设。
没有具象画面 — 纯粹的 lyric text input 与 scene interpretation,随音频能量反应。低频转变 narrative 色彩;高频触发 word-to-visual 粒子爆发。情绪弧线:主歌 text-driven、Drop 处爆发 creative、结尾沉静。当声音应该主导画面时,最适合。
三章节与歌曲结构同步。Ch.1(narrative):lyric text input 广角镜头,缓慢推进。Ch.2(text-driven):scene interpretation 中近景,能量上升。Ch.3(creative):word-to-visual 全画面,最高强度。0 秒置标题卡,结尾干净字幕 — 一次渲染就能上线。
一个包含歌词文本输入和横扫摄像机运动的叙事场景,沐浴在与节拍脉动的戏剧性灯光中
艺术家沉浸在场景诠释中,文本驱动的能量辐射穿过视频的每一帧和每一个切割
抽象词汇到视觉的变形和缓慢运动的流动,完美捕捉音乐的叙事本质
歌词文本输入的特写镜头溶解为歌词视频叠加层,创建遵循歌曲节奏的文本驱动视觉之旅
创意环境的广阔建立镜头,前景中的场景诠释,唤起深层情感共鸣
从发布日到完整的内容日历 — 用 Tunee 发布 Lyrics to MV 音乐视频的真实方式。