地铁急刹,金属尖叫,广播响起「请乘客注意扶稳」,人群骚动、孩子哭声、对讲机杂音一层层涌上来··· 你甚至能感觉到车厢在晃。 这不是电影原声带。整段声音是用一句 prompt,AI 一次性生成的。 再来听一首歌。先是一段清唱,没有伴奏,就是一个人对着麦克风干唱: 然后,AI 接手了。一句提示词—— 一首温暖柔和的 City Pop 男声歌曲,带一点爵士和轻摇滚的感觉,氛围朦胧浪漫 模型直接在这段清唱的基础上,补齐了编曲、和声、节奏和完整制作: 从一段干巴巴的清唱,到一首有呼吸感的完整歌曲。你能听出来这是 AI 做的吗? 说实话,我第一次听的时候也没分出来。
音频大模型,开始比「体系」了 过去两年,语音 AI 赛道非常热闹。 Suno 两天前刚发布了 v6 系列,OpenAI 的 GPT-Realtime-2 今年把实时语音推理能力拉到了 GPT-5 级别,Google 在 I/O 上把 Gemini Live 推到 70+ 语言的流式翻译。 但有一个现象值得注意:几乎所有玩家,都在比单项。 |
| |||||||||||||||||||||||

点击朱笔,直抒胸臆