AI大模型
字节跳动 SeedRealtime 音视频全双工大模型发布:支持边看、边听、边说 已上线豆包
字节跳动 Seed 今日宣布推出原生音视频全双工大模型 SeedRealtime,走向全模态自然交互。
SeedRealtime 用统一架构原生融合音频、视频与文本,能在连续的多模态信息流上实时交互,带来“边看、边听、边说”的全新体验。它实现了以下三项核心突破:
音视频联合理解:原生支持声音、画面与时序信息的深度融合。模型既能结合场景消解同音词歧义,也能准确理解视觉中的时序指代,让所见、所闻与所说融为一体。
主动的交互能力:具备持续的环境感知与主动表达能力。模型能在察觉画面状态变化时(如关键目标出现)主动提醒,并能调用工具融入表达,让交互从被动响应升级为主动协作。
流畅的交互节奏:能够实时感知用户的对话状态与交流节奏,在适当时机自然接话、停顿与回应;同时具备较强的抗干扰能力,能分辨旁人闲聊与背景噪声,不因干扰误触发,保持沟通的流畅连贯。
端到端人工评测结果显示,相比级联模型,SeedRealtime 的音视频对话节奏问题减少了一半 —— 模型对说话时机的把握更加自然,“话未说完被抢断、话音已落却回应迟缓、或是被背景杂音与闲聊误触发”等卡壳现象显著减少;同时,单次对话能够完整、顺畅交流的概率也有明显提升。

目前,SeedRealtime 已在豆包 App 全量上线,在业界率先实现了音视频全双工技术的规模化落地。将豆包 App 更新至最新版本,在对话框内选择“打电话”,进入视频通话界面体验即可。
IT人网附项目主页地址:
https://seed.bytedance.com/seedrealtime
相关阅读
-
英伟达发布首个全栈物理 AI 安全系统 Halos for Robotics
英伟达今天发布NVIDIAHalosforRobotics,这是业内首套将AI算力和安全能力整合在一起的全栈机器人安全系统,面向机器人和物理AI的开发、验证及工业部署。人形机器人和物理AI企业Agility将率先采用
-
龚宇期待AI创作出优质影视作品
在第十三届中国网络视听大会上,爱奇艺创始人、首席执行官龚宇表示,人工智能(AI)正为影视行业,尤其是长视频领域提供重要的振兴机会。龚宇指出,长期以来长视频平台采取“中心化”
-
智元机器人首个开放式具身智能体验中心在无锡开业聚焦C端文旅融合
智元机器人宣布旗下全国首家开放式具身智能体验中心在江苏无锡正式开业,该体验中心位于惠山古镇映月里街区,号称是首个面向C端消费者开放的具身智能文旅融合项目。据介绍,该体验中
-
OpenAI 最强 AI 模型:GPT-5.6 系列有望下周登场 生成 Win11 SVG 测试优于
科技媒体testingcatalog昨日(6月19日)发布博文,报道称OpenAI有望下周推出GPT-5.6系列模型,涵盖mini、标准版以及Pro版。部分Pro订阅网友在X平台发布推文,指出已支持访问GPT-5.6Pro模型


