CintaBox 芯塔盒在线工具箱

人声处理工具箱 — 免费在线工具

人声处理工具箱是 CintaBox 芯塔盒在线工具箱提供的免费在线工具:把 sherpa-onnx(Next-gen Kaldi)编译成 WebAssembly 跑在浏览器里,四个能力做成选项自选:**人声降噪** / **说话人分离**(谁在什么时候说话)/ **语音活动检测**(找出有人说话的时间段)/ ⭐ **关键词检索**(在长录音里找「某个词出现在第几分钟」,模型认的是拼音音素不是汉字,站内现场转换,官方锚点 16/16 逐条一致)。还能**按静音切除并导出**、**降噪前后 A/B 对比试听**、直接**用麦克风录**,结果条目**点一下就跳到那个时间点播放**;VAD 与关键词检索**边跑边出结果**(一小时录音不用干等,中途结果明确标着「进行中」)。⭐ **音频从头到尾没有离开过你的电脑** —— 没有上传、没有服务端、断网也能用。⭐ 四件别的同类工具通常不说、而不知道就会被坑的事:① ⭐⭐⭐ **说话人分离的「自动判断有几个人」实测九次里错五次,而且界面上完全看不出来。** 拿三段已知答案的录音各扫多档阈值:四人中文 57 秒在阈值 0.5(业界默认)下判成 **7 个人**、0.7 下 5 个、要到 **0.9 才对**;而双人英文 16 秒在 0.9 下把两个人**并成了一个**。**不存在一个通吃的阈值** —— 两段同样是「双人英文」,一段要低阈值一段要高阈值。📌 **最阴的一点:四人那段在每个阈值下都切成 10 段** —— 分段是稳的,错的只在「把这些段归给谁」,所以界面永远整整齐齐,**「看起来很规整」完全不能当作结果正确的证据**。⚠ 相比之下**直接告诉它有几个人那一档,三个样本全对** —— 所以本工具把「我知道有几个人」做成默认路径,自动档降级为带阈值滑杆的辅助并**每次都挂警告**。② ⭐ **本来就干净的录音,做降噪是负收益。** 给干净语音人工加噪再降噪量信噪比:加噪 0dB 提升 **+11.59dB**、5dB 提升 +10.14dB、10dB 提升 +8.43dB、20dB 提升 +4.41dB —— **噪声越小越不划算**;而**把干净语音直接送进去,出来只剩 15.53dB**,也就是说没有噪声可压时它只会削掉语音(清辅音、气声这些「长得像噪声」的成分)。工具给的两个读数(安静段降了多少 / 说话段降了多少)**只量能量,量不出金属音与水下咕噜声这类处理伪影**,这条盲区常驻在结果旁边而不是藏进帮助里。③ ⚠ **耗时没法准确预估,所以只给区间。** 实测处理时间与音频时长的比值不单调:16 秒→0.41、34 秒→**1.01**、57 秒→0.72 —— 决定快慢的是**里面有多少语音段**而不是总时长,拿时长线性外推出来的「还剩 X 秒」是假的。④ ⭐ **多声道一律混音而不是只取左声道**:有些双人录音把两个人分别录在左右声道,只取左声道会**整段丢掉一个人**,而分离会一本正经地报告「只有 1 个人」。📌 所有处理都在 Worker 线程里跑,处理期间页面照常能点能滚 —— 这不是顺手做的:这些算法本身是同步阻塞的,实测放主线程会让整页冻住 **39.8 秒**(57 秒音频)。与 media/video/teleprompter(语音跟读)、calc/video/ffmpeg-toolbox(自动字幕)互补:那两款做「说了什么」,这款做「谁说的 / 哪段有人说 / 把噪声去掉」。无需注册、无需安装软件,打开网页即可使用,处理全程在浏览器本机完成,文件不上传服务器。

立即使用 人声处理工具箱 →

功能特点

使用步骤

  1. 在浏览器中打开「人声处理工具箱」工具页面(点击本页“立即使用”按钮);
  2. 按页面提示输入内容或选择文件;
  3. 工具在浏览器本机即时处理并展示结果;
  4. 查看、复制或下载处理结果。

常见问题

人声处理工具箱是免费的吗?
是的,人声处理工具箱完全免费,无需注册、无广告干扰,打开即用。
我的文件/数据会被上传到服务器吗?
不会。人声处理工具箱的处理全程在你的浏览器本机完成,文件与数据不上传服务器,断网也能用,隐私安全。
需要安装软件或插件吗?
不需要。任何现代浏览器(Chrome / Edge / Firefox / Safari)直接打开网页即可使用,手机浏览器同样支持。

相关工具