工具推荐·阅读约 2 分钟·
StemDeck:免费开源的本地 AI 音频分离工具,无账户、无上传、无订阅

StemDeck:免费开源的本地 AI 音频分离工具,无账户、无上传、无订阅

StemDeck 基于 Meta 开源的 Demucs 模型,在本地把歌曲拆成人声、鼓、贝斯、吉他、钢琴等最多 6 轨,支持 YouTube 链接和 DAW 式混音编辑,是 Moises、LALAL.AI 这类云端服务的开源替代。

原文来源:GitHub - stemdeckapp/stemdeck — 免费、本地的开源音频分离工具,把歌曲拆成人声和伴奏等 6 个音轨,音频不出本机。

想从一首歌里抽出人声做练习伴奏、分离鼓点研究编曲、或者做混音素材?以往这类需求基本被 Moises、LALAL.AI 这类云端服务垄断:把音频传上服务器,处理完再下载,免费额度用完就订阅。StemDeck 是这类服务的开源替代——完全本地运行,不注册、不上传、不付费,目前 GitHub 上已有 3000 多星。

它解决什么问题

StemDeck 的核心能力是音源分离(stem separation):把一首歌拆成最多 6 个独立音轨——人声、鼓、贝斯、吉他、钢琴和其他。用途非常实际:歌手要消音版伴奏、贝斯手想单独听低音线条、制作人想扒某个乐器段落、播客想分离背景音乐和人声。隐私敏感的场景(比如商用素材、未发布 demo)也可以放心处理,音频从头到尾不出本机。

和云端方案对比,定位差异很清楚:StemDeck 免费、本地、无账户;Moises/LALAL.AI 是 freemium 订阅制、云端处理。StemDeck 的 README 甚至主动放了一张诚实对比表,承认商业产品在模型质量、移动端、额外功能(变调、和弦检测、歌词等)上仍然领先——它只认真覆盖核心场景,不假装全能。

—— 广告 ——

功能一览

  • 6 轨分离:基于 Meta AI 开源的 Demucs htdemucs_6s 模型,自动检测最佳计算设备(NVIDIA CUDA / Apple Silicon MPS / CPU 回退)
  • 双输入方式:粘贴 YouTube 链接,或直接拖入 MP3、WAV、FLAC、OGG/Opus、MP4、M4A 文件
  • DAW 风格编辑器:波形缩放、循环播放、多轨对齐预览,每轨独立推子、静音、独奏,带实时 VU 电平表
  • 自定义混合导出:选任意音轨组合导出 WAV,或保留"原曲减去所选轨"的伴奏轨做 A/B 对比
  • 歌曲分析:BPM(librosa 节拍追踪)、调性和弦(Albrecht-Shanahan profile)、响度(ITU-R BS.1770 LUFS)、峰值电平
  • 任务可取消:处理中途取消会终止子进程、清理临时目录
  • 库管理:按文件夹组织曲目,拖拽、搜索、回收站

技术架构

StemDeck 的栈相当干净:Python 3.12 + uv 管理依赖,FastAPI 提供 REST 和 SSE 后端,桌面壳用 Tauri v2(Rust),前端是纯 vanilla JS + Web Audio API,波形用 canvas 的 min/max 采样渲染——没有框架、没有构建步骤。视频下载走 yt-dlp,转码混音走 FFmpeg,BPM/调性分析用 librosa,响度测量用 pyloudnorm。可选的 lead/backing 人声分离还集成了 UVR-MDX-NET Karaoke 2 模型(来自 Ultimate Vocal Remover 项目)。

几个值得注意的工程细节。模型权重(约 170 MB)首次运行自动下载,之后走缓存,后续启动秒开;桌面版首次启动自备 Python 运行时(约 500 MB),不需要用户装任何系统依赖;Windows 版全部文件自包含在应用目录里,拷到哪都能跑。后端还暴露了完整的 REST API(/api/jobs、SSE 事件流、stem 导出、取消),意味着它可以被脚本化调用——不只是个图形工具。

上手路径

最简单的用法是下载桌面版:macOS 有 Apple Silicon(MPS 加速)和 Intel 两个 DMG,Windows 有 CPU 版和 NVIDIA CUDA 版(约 1.6 GB)。首次启动下载运行时和模型,之后拖入文件、选要分离的音轨、点 Process,等待 Analyzing → Separating → Mixing 完成即可。

想跑在服务器上也有多种方式:Linux/macOS 用 ./run.sh setup && ./run.sh start,Windows 用 PowerShell 跑 uvicorn,或者直接 docker compose up。NVIDIA GPU 用户装 CUDA 版 torch 后设置 STEMDECK_DEMUCS_DEVICE=cuda 即可加速;Unraid NAS 用户还能从社区应用商店一键安装。CPU-only 也能跑,就是慢——GPU 上几秒到几十秒的活,纯 CPU 可能要几分钟。

适合谁,不适合谁

适合:想免费分离音轨的业余音乐人、扒谱学习者;在意音频隐私、不想把文件传上云的人;喜欢自托管、想把这套东西接进自己工作流的开发者;NAS 用户。

不适合:需要移动端 App 的(没有 iOS/Android 版);需要变调、和弦检测、歌词等进阶功能的(README 明说没有);追求商业级分离质量或批量处理(一次只处理一个任务);以及"只想下载 YouTube 音频"的人——StemDeck 是分离工具,不是下载器,README 反复强调这一点。

一句话总结:如果你要的是"本地、免费、够用"的音源分离,StemDeck 是目前最省心的开源选择;如果你需要的是打磨过的产品体验和全套音乐人工具,商业服务仍然值得付费。

值得注意的限制和细节

几个使用中会碰到的实际限制,README 都写得很坦白。单次任务默认拒绝超过 1200 秒(20 分钟)的音频,可以用 STEMDECK_MAX_DURATION_SEC 调整;任务目录默认保留 24 小时后自动清理(STEMDECK_JOB_TTL_SECONDS 可配);同时最多排 3 个任务,超出返回 503。服务器重启后内存中的任务列表会清空,但磁盘上的文件都还在。

处理速度取决于硬件:NVIDIA GPU 上 Demucs 走 CUDA、Apple Silicon 走 MPS,都是秒级到分钟级;纯 CPU 慢很多但能用。首次运行要下载约 170 MB 模型权重,之后全部走缓存。如果你在意"音频不出本机",它的隐私边界很干净:处理全程本地,唯一需要联网的是 YouTube 下载和首次模型拉取。

开发者视角还有一个加分项:完整 REST API(/api/health/api/jobs 的增删查和 SSE 事件流、stem 的 WAV/MP3 流式导出、混音 MP4 输出)意味着可以把它嵌入自己的工具链——比如做批量处理脚本、或者接进音乐教学应用的后端,而不用碰它的桌面 UI。

分享到
微博Twitter

© 2026 四月

原文链接:https://www.aprilzz.com/tools/stemdeck-local-ai-stem-separation