ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

Audio8-ASR-0.1B核心功能全解析:从多语言支持到1.1GB低内存占用

Audio8-ASR-0.1B核心功能全解析:从多语言支持到1.1GB低内存占用 Audio8-ASR-0.1B核心功能全解析从多语言支持到1.1GB低内存占用【免费下载链接】Audio8-ASR-0.1B项目地址: https://ai.gitcode.com/hf_mirrors/Audio8/Audio8-ASR-0.1BAudio8-ASR-0.1B是一款紧凑型自回归语音识别模型其语言模型组件仅含0.1B参数支持中文、英文、法文、德文、日文、韩文及粤语等多语言语音识别是LLM时代最小可用的高性能ASR模型之一。 核心优势概览 多语言识别能力支持7种主流语言的语音转文字包括中文普通话/粤语英语、法语、德语日语、韩语模型采用Qwen3-ASR音频编码器与MLP适配器架构在保证识别精度的同时实现轻量化设计。 卓越性能表现在国际权威语音识别榜单Open ASR Leaderboard中英语七数据集平均WER低至7.03%LibriSpeech测试集clean分割WER仅2.70%中文WenetSpeech数据集CER达到7.976% 极致内存优化ONNX Runtime部署版本专为边缘设备优化峰值内存占用约1.1GB视设备/运行时配置有所差异iOS ANE版本更可低至200MB内存占用0.1B语言模型参数实现高性能与轻量化的平衡 快速开始指南环境准备git clone https://gitcode.com/hf_mirrors/Audio8/Audio8-ASR-0.1B cd Audio8-ASR-0.1B pip install -r examples/requirements.txt基础转录示例使用提供的Python脚本快速体验语音识别python examples/transcribe.py path/to/audio.wav --model . 热词增强功能无需微调即可提升特定词汇识别准确率python examples/transcribe_hotword.py path/to/audio.wav \ --model . \ --hotwords Audio8,AutoArk️ 技术架构解析模型组件音频前端Qwen3-ASR音频编码器 MLP适配器解码器8层Qwen风格因果语言模型总参数量约0.324B含323,990,528个独立参数文件组成config.json、model.safetensors及处理器配置文件核心特性采样率16kHz最大音频长度30秒可配置解码方式贪婪解码支持热词logit增强推理框架Hugging Face Transformers 部署方案边缘设备部署ONNX Runtime版本适合各类边缘设备Audio8-ASR-0.1B-onnx-runtime移动设备支持iOS专用版本针对iPhone优化200MB峰值内存占用原生ANE加速支持⚠️ 使用注意事项默认配置针对短语音30秒内优化热词增强需合理设置boost值过高可能导致识别偏差加载模型时需添加trust_remote_codeTrue参数推荐使用BF16精度GPU或FP32精度CPU运行 致谢音频编码器基于Qwen3-ASR-0.6B开发语言模型基于Ref-Pretrain-Qwen-104M构建感谢相关项目提供的技术基础。通过结合先进的架构设计与极致的工程优化Audio8-ASR-0.1B在保持高性能的同时实现了1.1GB级别的低内存占用为边缘设备语音识别应用提供了理想选择。无论是开发者集成还是个人使用这款模型都能以最小资源消耗带来优质的语音转文字体验。【免费下载链接】Audio8-ASR-0.1B项目地址: https://ai.gitcode.com/hf_mirrors/Audio8/Audio8-ASR-0.1B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表