模型规模为16亿参数,五种语言共用权重,无需预先指定语言;输出保持原语种,并支持逐词时间戳,便于定位音频内容。

TII 报告,六个阿拉伯语测试集的平均词错误率为20.92%,低于其9月30日榜单快照中的最佳已公布值23.17%;该比较使用固定测试清单,不代表所有口音或场景的排名。

影响与意义

对服务海湾地区用户的语音产品,方言覆盖和逐词定位具有实用价值。选型仍应以目标口音、电话音质和多人说话等真实录音检验错误率,转写指标也不能替代端到端 Agent 的任务成功率。

可用性与限制

官方已提供 Hugging Face 演示页面;API 访问和原生应用仍在计划中。发布文章未给出可下载权重或对应许可,现阶段不能据此认定已支持自托管部署。

官方来源