LOCAL ASR · REALTIME · ZERO NETWORK REC · 正在监听系统声音

声音所到之处,
皆有字幕

sub-title 捕获你的系统声音,用本地 GPU 驱动语音识别大模型, 在屏幕上实时生成中文字幕——看视频、听播客、开会议,从此自带字幕。

<0ms端到端延迟
0RTF 实时因子
0可切换识别引擎
0并行输入源

实时识别演示 · 悬停查看工具栏
01 · Engines

六种引擎,各有所长

从 234MB 的轻量模型到 1.7B 的多语种大模型,从纯 CPU 到 GPU 原生流式——在设置里一键切换,管线与界面完全不用改。「引擎管理」标签页还会告诉你每个引擎装没装好,没装就给你精确命令一键复制。

02 · Privacy

你的声音,不出这台电脑

本地引擎模式下,音频从系统输出到字幕上屏,全程不产生任何网络请求。

A

零网络请求

本地引擎完全离线,模型首次下载后不再联网。你的会议、网课、私聊内容,一个字节都不会出门。

B

系统级凭证保险箱

AccessKey / Secret 只存进 Windows Credential ManagermacOS KeychainLinux Secret Service,绝不写进配置文件。

C

不怕意外泄露

凭证不会被 git add . 误提交,不怕截图分享,不怕同步盘悄悄上传到云端。

D

MIT 开源,可审计

每一行代码都摊开在阳光下。没有黑盒,没有埋点,你看到的就是它运行的全部。

C:\Users\you> netstat -an | findstr ESTABLISHED
(空)
✓ 本地引擎模式下,出站请求:0

这是一条实时生成的字幕

HOVER · 鼠标移入试试
03 · Overlay

一块安静的
字幕玻璃

无边框、半透明、永远置顶。它浮在所有窗口之上,只在需要的时候露出工具栏。

01工具栏悬停显隐——鼠标移入出现,移开自动隐藏,延时可调
02透明度 0–100% 可调,双主题黑底白字 / 白底黑字
03字体字号随意调,字号支持直接输入数值
04位置与尺寸自动记忆,可拖动、可右下角缩放
05智能滚动——贴底时跟随最新,向上翻看时不被打断
04 · Sources

两路声音,
各认各的人

同时监听系统声音和麦克风,两路独立引擎配置。FunASR + cam++ 实时区分说话人,还能给每个人起名字。

01双输入源并行——电脑声音 + 麦克风同时采集,互不干扰
02独立引擎配置——系统声音用 FunASR 流式,麦克风用 SenseVoice,各取所长
03说话人实时区分——cam++ 声纹模型流式输出 spk_id,字幕前自动标注
04自定义显示名——把"说话人 1"改成"老板""室友""自己",按输入源分别记忆
05来源图标——系统声音和麦克风的字幕用不同图标区分,一眼看清谁在说
🖥 系统声音 · 🎤 麦克风
05 · Skins

字幕之上,
还能长出桌宠

内置可视化皮肤编辑器:图层、序列帧、关键帧、缓动、事件触发——把字幕条变成你的桌宠舞台。

PNG / WebP 图层 序列帧动画 逐属性关键帧 缓动曲线 关键词触发 音量触发 点击贴图 动作优先级与打断 ZIP 导入导出
SKIN EDITOR · 粉色猫咪.skin60 FPS
图层 1 · 猫咪.png
图层 2 · 音符.webp
字幕条
◇ 关键帧▮ 片段│ 播放头
06 · Themes

七套配色,随手换装

从 Dark 到 Dracula,内置七套主题;改坏了能一键恢复,自定义主题支持 JSON 导入导出。点下面的色板试试。

声音所到之处,皆有字幕

DARK
07 · Quick Start

五分钟,从安装到出字

Windows + NVIDIA GPU 是最顺滑的组合。装好 Miniconda 之后,剩下的交给两个批处理脚本。

STEP 01

安装 Miniconda

从官网下载 Windows 安装包,一路默认即可。已有 conda 环境可跳过。

STEP 02

双击 setup_env.bat

自动创建 subtitle 环境(Python 3.11),装好 funasr、PySide6 与 CUDA 12.1 版 torch。

STEP 03

双击 run.bat 启动

首次启动自动从 ModelScope 下载模型(约 1GB),之后字幕就开始跟着声音走了。

cmd — sub-title
# 1. 创建环境(或直接双击 scripts\setup_env.bat)
C:\> conda env create -f environment.yml
C:\> conda activate subtitle

# 2. 安装 GPU 版 torch(注意是 --index-url,不是 --extra-index-url)
C:\> pip install torch torchaudio --index-url https://download.pytorch.org/whl/cu121

# 3. 启动(或直接双击 run.bat)
C:\> set PYTHONPATH=src
C:\> python -m subtitle

✓ 字幕窗口已置顶,开始说话吧。

没有 GPU?设置里切到 SenseVoice,CPU 就能跑;或者用阿里云 NLS API,任意设备即开即用。

08 · FAQ

常见问题

没有独立显卡能用吗?

可以。选 SenseVoice 引擎,234M 小模型在 CPU 上就能流畅运行,适合 Mac 和无独显设备;也可以直接用阿里云 NLS API,任意设备都行。

为什么会出现没听过的「幻觉字幕」?

Whisper 类模型在静音、音乐暂停和片尾可能编造不存在的台词,VAD 只能缓解。中文音乐、歌词场景请优先使用 Fun-ASR-NanoQwen3-ASR

支持哪些操作系统?

Windows 10 / 11 体验最完整——系统声音捕获基于 WASAPI loopback。SenseVoice 引擎基于 PyTorch,macOS 与 Linux 也可以跑。

模型从哪里下载?

统一从 ModelScope 自动下载,首次运行对应引擎时触发,之后完全离线。仓库本身不包含任何模型权重。

收费吗?

软件以 MIT 协议开源,完全免费。只有选择阿里云 NLS API 引擎时才按语音时长计费,新用户通常有免费额度。

说话人区分是怎么工作的?

FunASR 引擎内置 cam++ 声纹模型,流式输出 spk_id。程序会在字幕前自动标注说话人编号,你可以在设置里把编号改成真实姓名或昵称,按输入源分别记忆。

能同时录麦克风和电脑声音吗?

可以。双输入源模式下,系统声音和麦克风各自独立采集、独立配置引擎。比如电脑声音用 FunASR 低延迟流式,麦克风用 SenseVoice 省显存——两路字幕在同一个窗口里用不同图标区分。

支持 macOS / Linux 吗?

正在为 exe / dmg 打包做跨平台兼容。SenseVoice 和 faster-whisper 引擎基于 PyTorch / CTranslate2,macOS 和 Linux 上已经可以跑;系统声音捕获目前 Windows 最完整(WASAPI loopback),其他平台可用麦克风输入替代。