字节跳动在2026年8月5日正式发布了原生音视频全双工大模型SeedRealtime。该模型采用统一架构,将音频、视频与文本原生融合,能够在连续多模态信息流上进行实时交互。
端到端人工评测显示,与级联模型相比,SeedRealtime的音视频对话节奏问题减少了一半。模型在把握说话时机方面更为自然,减少了话未说完被抢断、话音已落却回应迟缓、被背景杂音与闲聊误触发等情况。此外,单次对话完整顺畅交流的概率也显著提升。
目前,SeedRealtime已在豆包App全面上线。
华东新闻网 - 中国华东地区新闻门户,权威发布上海|江苏|浙江|安徽|福建|江西|山东最新资讯
© 华东新闻网