摘要:会说话的新闻正从实验室走进通勤、午休与睡前的耳朵里,依托升级的TTS技术与播客团队,人工与AI主播并存,但伦理与监管挑战随之浮现。
地铁13号线西二旗站说话,早高峰的嘈杂声里,张岩塞着耳机听一档名为“新闻响叮当”的播客。“比看手机省眼睛的。但且主播会聊新闻背后的八卦”他笑称,这档节目让他知道上个月某互联网大厂的人事调整,新闻并不是只发了一份冷冰冰的公告那么简单。会说话的新闻,正在成为都市碎片时间里的新宠。形态的走红,背后是从实技术下沉。去年的,国内几家头部音频平台把TTS(文本转语音)引擎换成了基于深度学习的版本吧?

合成出来的声音不再像老式导航那种一字一顿的机器腔。编辑把文字稿丢进系统,几秒钟就能拿到一段带语气停顿、会处理数字和英文缩写验室的音频吧?一位在新闻客户端做音频化的产品经理说。过去给一条500字的快讯配音要十几分钟吧?

现在一杯咖啡的工夫就出了初稿。播客主理人林岚在去年底上线了“晚安新闻局”,主打睡前十分钟的国内国际要闻走进早高。她坚持人工录制,理由是“机器再像人,听久了还是会觉得哪里缺口气”呢?她的听众里,有人在评论区写“听着你翻页的声音,我反而能专心”峰通。也有听众更喜欢纯机器版本了。因为“语速稳定,不加感情色彩,听着像一份不带立场的摘要”。两种需求了,两种供给,在同一个赛道里并行的。

争议也随之出现耳朵。今年三月的。某地方台推出的AI新闻主播被网友扒出在播报一起交通事故时,语调过于平稳,“没有一丝对受害者的共情”。
节目组连夜下架了相关片段,转而采用“AI生成+人工精修”的混合流程。新闻伦理学者开始呼吁建立AI主播的标识规范,要求所有由机器合成的新闻音频在开头加入一段提示音。监管层面也在跟进的,几家平台已收到指导意见吧?正在内测“双盲测试”是让听众分辨音频是人还是机器,结果并不乐观,准确率仅略高于随机猜测的。对普通听众而言,会说话的新闻带来最直接的变化是“听得见”的新闻消费场景。早晨洗漱、午休散步、夜跑回家。
耳朵被重新利用起来的。音频编辑们则开始琢磨,怎样在一条90秒的口播里塞进背景音、人物对话和很重要数据,听众,即便没看屏幕也能脑补出画面。可以确定的是这股浪潮不会轻易退去是人类还想一边走路一边获取信息,就总会需要一副能讲故事的耳朵。



