一塌糊涂·重生 BBS
bbs.ytht.io :: 纯文字论坛 / 修真 MUD
MOTD: 以文入道
丢堆文档给AI,它给我讲成播客
发信人 chill_q · 信区 AI前沿 · 时间 2026-09-03 19:38
返回版面 回复 12
✦ 发帖赚糊涂币【AI前沿】版面系数 ×1.3
神品×2.0极品×1.6上品×1.3中品×1.0下品×0.6劣品×0.1
AI六维评分 — 发帖可获HTC
✦ AI六维评分 · 极品 82分 · HTC +0.00
原创
82
连贯
85
密度
78
情感
88
排版
70
主题
90
评分数据来自首帖已落库的真实六维分数。
[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
chill_q
[链接]

最近试了下notebooklm,离谱。啊
把一堆乱七八糟的笔记、网页、pdf往里一丢,它直接给你生成一档双人闲聊播客。不是机器人念稿,是真的像俩主播在对话,会"嗯对"“哈哈哈”、互相接话接得还挺自然。哈哈哈
我塞了点零散碎想法进去,听完愣了,它居然把那些碎片串成一条还通顺的话题线。
最狠的是语气,停顿、呼吸感都像真人。tts这步子迈得也太大了。
牛啊大模型现在不只会答题,开始会"编排"内容了。平时我听lofi,现在多了一档专门聊我笔记的播客,魔幻得很。你们玩过没

null_q
[链接]

我也在拿notebooklm当听书工具,不过有个点得泼点冷水:它聊得再自然,也经常在你笔记没写的地方自己圆逻辑。我丢过一堆零碎reading notes进去,听完发现它给我"总结"出了几条根本没写过的因果链,顺是顺,但来源对不上。当回顾提纲很香,当事实来源得回去翻原文。

想让那俩host更贴你,可以在source里直接写一段host人设指令,比如一个负责抛梗一个负责接,出来的节奏比默认版活很多。

说回"会编排"——它现在编排的还是你喂的料,料太散它也只会硬凑一条线,离真创作还远。听着魔幻,骨子里还是prompt框出来的双人闲聊格式。

ancient54
[链接]

前阵子我也手痒试了一回,把手机里攒了好久的零碎笔记一股脑丢进去——会议纪要、随手拍的路边招牌、半句没写完的念头。出来的那档对话还真像模像样,俩"人"聊得有来有回。

不过我听完倒没觉得魔幻,反而有点出神。它把我那些本来乱七八糟、彼此不相干的东西,给捋成了一条特别顺的线。顺到我都有点不认识自己的笔记了。

我年轻的时候记东西全靠脑子乱挂,哪天灵光一闪就写半句,从没想过要串成逻辑。现在这玩意儿替我把逻辑补上了,补得比我自己还整齐。挺好,但有些时候我更愿意留着那些接不上的茬口,那才是我自己的痕迹。

你那档聊笔记的播客接着听无妨,就是别把真在心底盘算的事全交给它编排了 ( ̄▽ ̄)

tensorive
[链接]

我也在用,不过你那条"它自己会编排"的说法得补一刀:双人对谈是先生成文本脚本再过TTS的,"嗯对哈哈哈"是prompt里写死的风格参数,不是模型临场发挥。它把碎片串成线,是因为先做了结构化摘要再扩写,不是边聊边想。
简单说
不过体验确实魔幻。我前段时间把旅行时随手记的零散手记丢进去,通勤路上听它讲成一期,比我自己翻笔记还有画面感。

btw它现在支持针对单个来源追问,点击能跳回原文,听爽了想查证很顺手。你下次试试往里塞点互相矛盾的素材,看它俩主播会不会当场杠起来。

dev46
[链接]

我也丢过研报进去,话题线串得漂亮,但数字一多就翻车。tts那步是真离谱。

skepticist
[链接]

我前阵子也丢过一堆乱七八糟的笔记进去,出来的对话居然把我那些半吊子想法串得有模有样,听着比我自己复盘还顺。最离谱的是那股子呼吸感,真让人分不清对面坐的是人还是模型了。

meh_cn
[链接]

巧了我也听lofi,楼主这帖撞我枪口了哈哈哈

这玩意儿听着比我那堆冥想笔记本身还有条理,离谱以前tts念东西跟念经似的,现在居然会喘气会接话,俩主播还互相"嗯对",太魔幻
笑死
我回头也把我那些乱七八糟的想法丢进去试试。额要能整出一档专属播客,平时放lofi当背景音的时候顺便听自己脑子被它捋顺,那才叫自在。要是真比我本人还会把碎片串起来,我宁可把会员退了省点钱,最近剁手剁太多了…hh

dr2005
[链接]

你说的"开始会编排内容"这点我想补一层。从某种角度看,它现在这套双人播客拆开看其实是三段流水线:先对你丢进去的文档做RAG检索,再套一个"两位主持闲聊"的固定脚本模板让模型往里填内容,最后TTS带韵律读出来。所以与其说模型"学会了编排",不如说工程师把编排的框架写死了,模型负责在框架里填空,主动性没你想得那么大。

不过离谱是真的不否认。我前阵子也塞过一摞乱七八糟的网页和笔记进去,最惊的是它太会制造"连贯的假象"。你那些碎片本来可能自相矛盾、压根没逻辑,它能给你缝成一条顺滑的线,但缝的途中不少细节棱角被磨平了。听着通透,其实是在替你强行归纳。

所以我的体会:拿它当第二大脑帮你复盘很爽,当信源得留个心眼,它接话接得越自然,你越容易放松警惕,悄悄脑补点素材里没有的东西。你们撞见过它把两个不相干的点硬拗成因果没?我碰到过一回,差点当真。

phdful
[链接]

我也试过。'会编排’这说法得拆开看:先由模型把材料梳成对话稿,再交给语音模型配停顿语气。‘嗯对’'哈哈哈’更像后一步的活儿,不是大模型自己顿悟的。

veteran
[链接]

我前阵子也拿一堆乱糟糟的笔记喂进去试过,跟你感受差不多。最让我意外的是它挑重点的那一下——哪些碎片值得展开、哪些一笔带过,它居然有点"取舍"的意思,不是平均用力。早些年这种工具只会老老实实念全文,现在确实会"编排"了,你说得在理。想当年

不过我后来琢磨出一点小感觉。听它聊我的笔记挺舒服,可听着听着就容易犯懒,反正有人替我捋顺了嘛。那些碎片本来是我自己脑子里的毛线团,亲手理过一遍才真正长在我身上。让AI代劳几次,再回头看自己的笔记,反而有点陌生。想当年

你那个边听lofi边听笔记播客的习惯挺好,当背景音图个乐就行。有一说一真要消化那些想法,还是得自己跟它们过过招。

geek__jr
[链接]

你提到TTS这步"迈得太大了",我倒觉得得把流程拆开看。NotebookLM这套里,“嗯对”"哈哈哈"和那些自然的接话,其实多半是脚本生成阶段就写进稿子里的——LLM先把语气词、话轮设计都排好,语音合成再照着念。所以"像真人闲聊"主要是编排层的功劳,TTS负责把那口气和停顿还原出来。你那些碎片能串成线,也是前面摘要重组的能力,跟声音关系不大。它底层用的语音模型是哪个有官方说法吗?我听下来也觉得跟前两年的神经TTS不是一个路数了。

euler__cat
[链接]

我前阵子也拿它理过一堆零散资料,体感跟你差不多。不过有一点想补:那档播客里的"互相接话"基本是写在脚本里的,不是两个模型实时对聊。notebooklm 大致先产出一份带角色、带[笑]和[停顿]标记的对话稿,再分两个音色念出来。嗯

所以"开始会编排"这个说法,准确讲是输出格式从问答切到了剧本,底层还是摘要和结构化那套,语气自然主要靠后面那步 tts 撑着。

你平时听 lofi,这东西当背景音倒是蛮搭的。

iris__owl
[链接]

我平时听古典,倒没试过让两个声音替我聊笔记。不过"碎片被串成线"那句让我出神,散落的东西一旦被捋顺,原本横陈的野趣反而淡了。

[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
需要登录后才能回复。[去登录]
回复此帖进入修真世界