
StemDeck:免费开源的本地 AI 音频分离工具,无账户、无上传、无订阅
StemDeck 基于 Meta 开源的 Demucs 模型,在本地把歌曲拆成人声、鼓、贝斯、吉他、钢琴等最多 6 轨,支持 YouTube 链接和 DAW 式混音编辑,是 Moises、LALAL.AI 这类云端服务的开源替代。
原文来源:GitHub - stemdeckapp/stemdeck — 免费、本地的开源音频分离工具,把歌曲拆成人声和伴奏等 6 个音轨,音频不出本机。
想从一首歌里抽出人声做练习伴奏、分离鼓点研究编曲、或者做混音素材?以往这类需求基本被 Moises、LALAL.AI 这类云端服务垄断:把音频传上服务器,处理完再下载,免费额度用完就订阅。StemDeck 是这类服务的开源替代——完全本地运行,不注册、不上传、不付费,目前 GitHub 上已有 3000 多星。
它解决什么问题
StemDeck 的核心能力是音源分离(stem separation):把一首歌拆成最多 6 个独立音轨——人声、鼓、贝斯、吉他、钢琴和其他。用途非常实际:歌手要消音版伴奏、贝斯手想单独听低音线条、制作人想扒某个乐器段落、播客想分离背景音乐和人声。隐私敏感的场景(比如商用素材、未发布 demo)也可以放心处理,音频从头到尾不出本机。
和云端方案对比,定位差异很清楚:StemDeck 免费、本地、无账户;Moises/LALAL.AI 是 freemium 订阅制、云端处理。StemDeck 的 README 甚至主动放了一张诚实对比表,承认商业产品在模型质量、移动端、额外功能(变调、和弦检测、歌词等)上仍然领先——它只认真覆盖核心场景,不假装全能。
—— 广告 ——
功能一览
- 6 轨分离:基于 Meta AI 开源的 Demucs
htdemucs_6s模型,自动检测最佳计算设备(NVIDIA CUDA / Apple Silicon MPS / CPU 回退) - 双输入方式:粘贴 YouTube 链接,或直接拖入 MP3、WAV、FLAC、OGG/Opus、MP4、M4A 文件
- DAW 风格编辑器:波形缩放、循环播放、多轨对齐预览,每轨独立推子、静音、独奏,带实时 VU 电平表
- 自定义混合导出:选任意音轨组合导出 WAV,或保留"原曲减去所选轨"的伴奏轨做 A/B 对比
- 歌曲分析:BPM(librosa 节拍追踪)、调性和弦(Albrecht-Shanahan profile)、响度(ITU-R BS.1770 LUFS)、峰值电平
- 任务可取消:处理中途取消会终止子进程、清理临时目录
- 库管理:按文件夹组织曲目,拖拽、搜索、回收站
技术架构
StemDeck 的栈相当干净:Python 3.12 + uv 管理依赖,FastAPI 提供 REST 和 SSE 后端,桌面壳用 Tauri v2(Rust),前端是纯 vanilla JS + Web Audio API,波形用 canvas 的 min/max 采样渲染——没有框架、没有构建步骤。视频下载走 yt-dlp,转码混音走 FFmpeg,BPM/调性分析用 librosa,响度测量用 pyloudnorm。可选的 lead/backing 人声分离还集成了 UVR-MDX-NET Karaoke 2 模型(来自 Ultimate Vocal Remover 项目)。
几个值得注意的工程细节。模型权重(约 170 MB)首次运行自动下载,之后走缓存,后续启动秒开;桌面版首次启动自备 Python 运行时(约 500 MB),不需要用户装任何系统依赖;Windows 版全部文件自包含在应用目录里,拷到哪都能跑。后端还暴露了完整的 REST API(/api/jobs、SSE 事件流、stem 导出、取消),意味着它可以被脚本化调用——不只是个图形工具。
上手路径
最简单的用法是下载桌面版:macOS 有 Apple Silicon(MPS 加速)和 Intel 两个 DMG,Windows 有 CPU 版和 NVIDIA CUDA 版(约 1.6 GB)。首次启动下载运行时和模型,之后拖入文件、选要分离的音轨、点 Process,等待 Analyzing → Separating → Mixing 完成即可。
想跑在服务器上也有多种方式:Linux/macOS 用 ./run.sh setup && ./run.sh start,Windows 用 PowerShell 跑 uvicorn,或者直接 docker compose up。NVIDIA GPU 用户装 CUDA 版 torch 后设置 STEMDECK_DEMUCS_DEVICE=cuda 即可加速;Unraid NAS 用户还能从社区应用商店一键安装。CPU-only 也能跑,就是慢——GPU 上几秒到几十秒的活,纯 CPU 可能要几分钟。
适合谁,不适合谁
适合:想免费分离音轨的业余音乐人、扒谱学习者;在意音频隐私、不想把文件传上云的人;喜欢自托管、想把这套东西接进自己工作流的开发者;NAS 用户。
不适合:需要移动端 App 的(没有 iOS/Android 版);需要变调、和弦检测、歌词等进阶功能的(README 明说没有);追求商业级分离质量或批量处理(一次只处理一个任务);以及"只想下载 YouTube 音频"的人——StemDeck 是分离工具,不是下载器,README 反复强调这一点。
一句话总结:如果你要的是"本地、免费、够用"的音源分离,StemDeck 是目前最省心的开源选择;如果你需要的是打磨过的产品体验和全套音乐人工具,商业服务仍然值得付费。
值得注意的限制和细节
几个使用中会碰到的实际限制,README 都写得很坦白。单次任务默认拒绝超过 1200 秒(20 分钟)的音频,可以用 STEMDECK_MAX_DURATION_SEC 调整;任务目录默认保留 24 小时后自动清理(STEMDECK_JOB_TTL_SECONDS 可配);同时最多排 3 个任务,超出返回 503。服务器重启后内存中的任务列表会清空,但磁盘上的文件都还在。
处理速度取决于硬件:NVIDIA GPU 上 Demucs 走 CUDA、Apple Silicon 走 MPS,都是秒级到分钟级;纯 CPU 慢很多但能用。首次运行要下载约 170 MB 模型权重,之后全部走缓存。如果你在意"音频不出本机",它的隐私边界很干净:处理全程本地,唯一需要联网的是 YouTube 下载和首次模型拉取。
开发者视角还有一个加分项:完整 REST API(/api/health、/api/jobs 的增删查和 SSE 事件流、stem 的 WAV/MP3 流式导出、混音 MP4 输出)意味着可以把它嵌入自己的工具链——比如做批量处理脚本、或者接进音乐教学应用的后端,而不用碰它的桌面 UI。
© 2026 四月
原文链接:https://www.aprilzz.com/tools/stemdeck-local-ai-stem-separation
相关文章
Llamafile:用一个文件分发和运行 LLM
Mozilla 开源的 Llamafile 把 LLM 权重和运行时打包成单个可执行文件,双击即可运行,无需安装依赖。
tare:让 Claude Code 自己交代 token 都花哪儿了,配额超限不再是玄学
Claude Code 的日志早就记下了每一次请求,tare 教它读懂自己的日志——用一句大白话就能查出为什么配额烧得这么快、哪个项目在吃你的额度、上下文成本到底有多贵。
Tailcat:不要账户、不要 root,一条命令打通两台机器的加密隧道
Tailscale 官方开源的 netcat 替代品:用 WireGuard 加密两台机器之间的所有流量,不需要 Tailscale 账户、不碰路由表和 DNS,还自带 NAT 打洞。