经过查询得知,SALMONN 模型支持语音、跳动听觉音频以及音乐输入,开源它可以感知和理解不同类型的言模音频内容输入,并具备多语言语音识别和翻译以及语音推理等功能。清华
▲ 官方发布的大学大语模型解析图官方表示,SALMONN 支持语音、联合音频以及音乐输入,字节它可以感知和理解不同类型的跳动听觉音频内容输入,并具备多语言语音识别和翻译以及语音推理等功能。开源
▲ 图源 SALMONN 的言模 Demo 页面官方同时表示,目前 SALMONN 能够胜任英语语音识别、清华英语到中文的语音翻译、情感识别、音频字幕生成、音乐描述等重要的语音和音频任务,同时又涌现出多种在模型训练中没有专门学习过的多语言和跨模态能力,涵盖非英语语音识别、英语到(中文以外)其他语言的语音翻译、对语音内容的摘要和关键词提取、基于音频的故事生成、音频问答、语音和音频联合推理等任务。
目前该模型已经发布于 GitHub 中,官方同时放出了项目的 Demo 链接,感兴趣的小伙伴们可以前往了解。
广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,所有文章均包含本声明。
(责任编辑:探索)