Speech Workbench 想把本地语音模型从零散命令整理成一套可连续使用的 Windows 桌面工作流。

三类语音任务,一个工作台

它提供中文语音生成、语音转文本和音效素材生成三类能力:TTS 基于本地 VoxCPM2,STT/ASR 可使用 Whisper-large-v3-turbo 或 faster-whisper-small,AudioFX 则用于生成雨声、铃声、脚步声和环境音等非语音素材。

本地优先的桌面体验

项目使用 PyQt6 提供图形界面,支持离线运行、模型目录识别、源码运行或打包为 exe。每个页面都有独立的任务队列和后台线程,适合需要反复试音、批量转写或积累音效素材的本地工作流。

项目地址:Speech Workbench。