资讯详情

资讯详情

MLX-Audio 实战:2 条命令跑通 Mac 上的本地语音合成

MLX-Audio 实战2 条命令跑通 Mac 上的本地语音合成【免费下载链接】mlx-audioA text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apples MLX framework, providing efficient speech analysis on Apple Silicon.项目地址: https://gitcode.com/GitHub_Trending/ml/mlx-audio想在 Mac 上跑文本转语音或语音识别通常只有两个不理想的选项云 API 按量计费、音频要离开本机CUDA-only 的本地开源模型在 Apple Silicon 上又跑不起来。MLX-Audio 把主流语音模型搬到 MLX 上文本转语音、语音识别、语音转换都能在 M 系芯片上本地运行不依赖 NVIDIA 显卡。为什么在 Apple Silicon 上本地跑语音模型它的差异不在模型本身而在运行时。Whisper large-v3-turbo 覆盖 99 语言转写可以直接在本机完成Kokoro 只有 82M 参数、54 个预置音色、8 种语言8GB 统一内存的老 M1 也能从容加载。更实际的好处是量化支持 3、4、6、8 bit 以及 mxfp44bit 体积约为 fp16 的 1/4。比如 7B 的 KugelAudio 在 bf16 下需要约 17GB 内存换成低精度 checkpoint 占用直接减半——M 系机器统一内存紧张这决定了大模型能不能跑得动。2 条命令拿到第一段音频安装是一行命令按能力装 extra只装 tts 不会拉进 STT 依赖pip install mlx-audio[tts]然后生成第一段语音。这个例子用的是 8bit 量化的 0.6B Qwen3-TTS模型首次运行会自动下载生成的 wav 落在当前目录mlx_audio.tts.generate \ --model mlx-community/Qwen3-TTS-12Hz-0.6B-CustomVoice-8bit \ --text Hello, world! --voice Vivian加--play可以直接听。Python 侧同样轻量mlx_audio.tts.utils里的load_model传入模型 ID迭代generate就能拿到波形细节见 Python 快速上手。常见的 3 种用法批量音频生产。最有说服力的证据在仓库示例里examples/bible-audiobook/ 调用本地 API 服务把 31,102 节经文逐句转成 86 小时的音频作者用一台 24GB 的 M4 Pro Mac mini 跑了 28 小时。做整书配音、课程音频这类活儿这是可以照抄的工程样板。音频转文字。Whisper 覆盖 99 语言VibeVoice-ASR 支持最长 60 分钟的录音输出带说话人分离和时间戳也支持流式输出。会议纪要、字幕制作这类场景整条链路可以留在本机。接入现有服务。mlx_audio.server起一个 OpenAI 兼容的 REST API/v1/audio/speech和/v1/audio/transcriptions与官方接口对齐已经在用 OpenAI SDK 的代码基本改个 base URL 就能切过来。下一步从试用到真正用起来先翻 Python 快速上手 过一遍各模型的调用方式内存小的机器看 量化指南优先挑 4bit 的 checkpoint。要输出 MP3 需要 ffmpeg只出 WAV 可以跳过。建议第一次先挑一个小模型生成三句话听一下音质再决定往哪个方向深入。【免费下载链接】mlx-audioA text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apples MLX framework, providing efficient speech analysis on Apple Silicon.项目地址: https://gitcode.com/GitHub_Trending/ml/mlx-audio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →