- 积分
- 2345
- 阅读权限
- 200
- 主题
- 246
- 帖子
- 2007
- 注册时间
- 16-9-27
- 在线时间
- 2359 小时
- UID
- 5
- 精华
- 46

管理员
- 大洋
- 26390
- 阅读权限
- 200
|
中秋放假闲来无事,用Qwen3-ASR做了个音频转写字幕的小工具。GUI用的pyside6,模型加载器用的Audio.cpp(vulkan版本,AMD还没有ROCm优化版)。
测试机器:
CPU:AMD RYZEN AI MAX+ 395
GPU:Radeon 8060S
内存:128G(64G划给了GPU)
模型加载器:
audio-v0.8.2-audio8-perf-hotfix-bin-windows-x64-vulkan
audio.cpp下载地址:https://github.com/0xShug0/audio.cpp,根据自己使用的GPU选择合适版本的。
测试用的模型:
语音识别模型:qwen3-asr-1.7b-q8_0.gguf(2.3G)
对齐器模型:qwen3-forced-aligner-0.6b-q8_0.gguf(1.05G)
说话人分离模型:sortformer-diar-4spk-v1-f16.gguf(236MB)
VAD模型:silero_vad_16k.safetensors
以上模型要用audio.cpp的专有gguf格式,下载地址:https://huggingface.co/audio-cpp/audio.cpp-gguf
语音识别模型用来将语音转换为文字。VAD模型负责找到“人声”的起止位置。对齐器模型用来生成精确的时间轴。说话人分离模型用来将长句里面不同人说的话拆分为多条字幕,这个效果不怎么样,所以做成可选项了。核心难点是断句,多番测试下来,还是按说话间隔时间来断句更理想。
整个程序跑起来,显存占用最多7G多一点,所以8GB显存的显卡可以完全在GPU上跑,属于普通人都玩得起的了。速度方面,一条90分钟的音轨六、七分钟就可以跑完。字幕质量方面,感觉还行,90%以上的准确率吧,大家可以多试试,提出优化方案继续优化。
使用很简单,设置好模型的位置和audio.cpp的目录后,选择音轨,点击开始识别就自己干活了。启动后会有个两三分钟进度条没有反应,不要着急,那是在做切片等准备工作。后续的精调建议在Aegisub或srtedit上操作。
|
本帖子中包含更多资源
您需要 登录 才可以下载或查看,没有帐号?立即注册
x
评分
-
查看全部评分
|