AI大模型
英伟达推出 Audex 统一模型30B 参数解决多模态扩展后文本能力下降
英伟达于今年 6 月发表论文,推出 Audex(Nemotron-Labs-Audex-30B-A3B)统一音频-文本大语言模型,总参数量 30B,激活参数 3B,在保留核心文本智能情况下,能理解和生成音频(audio)和语音(speech)。
该模型骨干为文本模型 Nemotron-Cascade-2-30B-A3B,后者为 52 层混合 Mamba-Transformer 结构,包含 128 个可路由专家、每次激活 6 个专家。

该模型的设计目标是避免多模态扩展后文本能力下滑问题。论文显示,Audex 将音频输入编码后映射到文本嵌入空间,并把量化后的音频输出标记与文本标记统一处理。
在音频组件上,Audex 使用 AF-Whisper(音频编码器)处理 16kHz 输入,配合两层 MLP 适配器映射特征,输出词表从原始 131072 个 Token 扩展至 205312 个 Tokens。

语音输出采用 X-Codec2(语音编解码器),速率为每秒 50 个标记,使用单层 finite scalar quantization(有限标量量化),码本大小为 65536。非语音音频采用 X-Codec(音频编解码器),速率为每秒 200 个标记,使用 4 层展平残差向量量化。
文本评测方面,Audex 在 MMLU-Redux 上得分 86.4,高于骨干模型的 86.3;在 IMO AnswerBench 上为 81.1,高于骨干的 79.3,但在 MMLU-Pro 与 GPQA-Diamond 上出现小幅下降。
IT人网附上参考地址
Unified Audio Intelligence Without Regressing on Text Intelligence
相关阅读
-
英伟达Vera Rubin平台预计7月向主要AI客户交付下半年将实现大规模生产
据科技媒体Wccftech今天报道,产业链消息人士透露,英伟达已经与ODM厂商敲定VeraRubin平台的最终生产方案。据报道,VeraRubin的上市计划将分为多个阶段稳步推进。试产预计在下个月启动
-
传奇芯片设计师杰拉德·威廉姆斯三世携 AI 再创业致力于革新 CPU
芯片设计师、前高通工程师、Nuvia联合创始人GerardWilliamsIII(杰拉德·威廉姆斯三世)当地时间4月15日宣布,与前高通工程师JohnBruno、RamSrinivasan一同创立NUVACORE公司。
-
欧盟对AI产业链进行审查英伟达、Meta等科技巨头遭反垄断调查
据彭博社报道,欧盟反垄断负责人表示,大型科技公司在人工智能技术全产业链中的影响力正受到审查,因其可能存在扭曲市场竞争的行为。特蕾莎·里韦拉对相关企业可能在人工智能市场“巩
-
微信加强自媒体内容来源标注 严查虚构情节与AI生成内容
今日,微信发布《微信关于持续强化“自媒体”创作者信息来源标注的公告》。公告称,微信绿色、安全的平台生态离不开广大“自媒体”创作者的共同构建,为进一步规范“自媒体”创作行为


