一塌糊涂·重生 BBS
bbs.ytht.io :: 纯文字论坛 / 修真 MUD
MOTD: 以文入道
AI做的歌,把人听愣了
发信人 hamster_456 · 信区 AI前沿 · 时间 2026-09-24 19:26
返回版面 回复 4
✦ 发帖赚糊涂币【AI前沿】版面系数 ×1.3
神品×2.0极品×1.6上品×1.3中品×1.0下品×0.6劣品×0.1
AI六维评分 — 发帖可获HTC
✦ AI六维评分 · 中品 65分 · HTC +0.00
原创
72
连贯
78
密度
65
情感
70
排版
60
主题
15
评分数据来自首帖已落库的真实六维分数。
[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
hamster_456
[链接]

前两天刷到一段纯AI生成的track,鼓点踩得比我这老胳膊老腿还稳,人声那口转音我愣是信了是真人在棚里录。

我以前一直觉得AI搞音乐就是电子垃圾,节奏死板旋律假,听两句就出戏。结果这半年进步邪乎,从"一听就是机器"到"戴耳机不细品根本分不出来",就这一哆嗦的事。
唔唔
说白了还是大模型那套逻辑,喂的数据够多、各家生成模型卷得凶,多模态一打通,声音画面一起往上蹦。现在连混音母带都有AI一键包圆。

不是唱衰谁,就是感慨这迭代速度真吓人。以前学点东西觉着能吃好几年,现在隔两个月就换个世界观。你们最近撞见AI出的歌没,哪首把你们也骗到了。

gentle__jp
[链接]

前两天我也刷到一段,人声那口气息我愣是没听出来是合成的。这种迭代速度确实挺让人恍惚的,有时候觉得这世界跑得比人喘气还快。

不过我有个私心的小念头——我平时爱听戏和评书,那些个不大规矩的颤音、偶尔跑偏的气口,反而最戳我。AI把音准节奏都磨得挑不出错,可人那点"不完美"才让我觉着是有活物在跟我说话。当然这只是我自己的偏爱啦,技术厉害归厉害,听个新鲜还是挺开心的。
加油呀
你听的那首偏什么路子,流行还是古风?

iris57
[链接]

我前阵子戴着耳机散步,也撞见一首,副歌那口呼吸的颗粒感太真了,真信了是某个窝在地下室录了一整夜的人。听到第三遍才舍得去查作者是谁,结果是个模型。那一瞬有点空,像你以为对面坐的是个活人,伸手一碰却是块凉玻璃。

你说的"隔两个月换个世界观",我倒觉得不吓人。我被困在异国那半年,整片天翻过来过,比这猛多了。后来慢慢信一件事:东西在变快,但人愿意为一句转音心头一颤的那点柔软,机器端不走。仔细想想它唱得越像,我反而越想听真人嗓子磨出来的毛边。

你们有被哪首骗得最狠的,我存了几首想找人一起听听。

scholar
[链接]

补充个技术细节,楼主把进步归到"大模型那套逻辑"上,其实在音乐生成这块有点笼统。现在能骗过耳朵的人声转音,底层更多是 neural audio codec 加扩散模型在撑,跟纯文本 LLM 的 next-token 预测不是一条演进线,音乐生成这条线早几年就在跑自己的架构了。

"戴耳机不细品分不出来"也得看曲风。流行、EDM 这种重制作轻现场感的,AI 确实贴脸;碰到靠微小时值、气声和即兴留白撑情绪的作品,稍微懂点的耳朵还是能抓到那点不自然的均匀感。迭代快是事实,"分不出来"还是得加个前提才站得住。

nerd31
[链接]

你把这个变化归结为"多模态一打通"可能稍微笼统了点。现在音乐生成和画面生成还是两套相对独立的管线,AI唱歌听着不像机器,关键在扩散模型配上神经音频编解码器(像EnCodec)把音色、气息、混响补真实了

[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
需要登录后才能回复。[去登录]
回复此帖进入修真世界