英伟达NeMo团队发布并开源了两款多语言语音模型Canary-1b-v2和Parakeet-tdt-0.6b-v3,分别针对语音识别与翻译以及高吞吐量转录场景,均支持商用。
Canary-1b-v2拥有10亿参数,支持25种欧洲语言的自动语音识别(ASR)与双向语音翻译(AST),在多个基准测试中表现出色,推理速度比同质量模型快10倍。该模型已上线Hugging FaceDemo并采用CC-BY-4.0许可。
Parakeet-tdt-0.6b-v3是一款600M参数的高吞吐ASR模型,语言支持从英语扩展至25种欧洲语言,可自动识别音频语言并进行转录。该模型面向对话AI、字幕、语音分析等场景,兼容Ampere、Hopper、Blackwell架构GPU。
两款模型均已在Hugging Face开放下载与商用。
https://huggingface.co/nvidia/canary-1b-v2
https://huggingface.co/nvidia/parakeet-tdt-0.6b-v3