Appearance
本地离线语音转文字,无需 API Key
OpenAI Whisper 是 OpenClaw 的本地语音转文字 Skills 技能,Whisper CLI 驱动,完全本地运行无需 API Key,支持多语言实时转录。
核心功能
- 本地离线运行:无需上传云端,完全隐私
- 多语言支持:支持中文、英文等 100+ 语言
- 高准确率:Whisper large-v3 模型,业界领先准确率
- 音频格式广:支持 mp3/wav/m4a/ogg 等主流格式
- 批量转录:支持一次性转录多个音频文件
应用场景
- 会议记录:将会议录音快速转录为文字稿
- 播客字幕:自动为音频/视频生成字幕
- 采访整理:将采访录音转写为可编辑文字
- 语言学习:听写练习和语音评估
安装方法
OpenClaw 支持多种渠道安装 Skills,以下五种方法均可完成安装:
方法一:OpenClaw CLI(推荐)
bash
openclaw skills install openai-whisper方法二:ClawHub 官网
- 访问 ClawHub 并登录 GitHub 账号
- 搜索「openai-whisper」进入技能详情页
- 点击「Install」按钮,按提示完成安装
方法三:国内镜像站(推荐国内用户)
bash
openclaw skills install openai-whisper --mirror https://cn.clawhub-mirror.com或访问镜像站直接安装:cn.clawhub-mirror.com
方法四:skills.sh
bash
openclaw skills install openai-whisper --source skills.sh或访问 skills.sh 搜索技能名称在线安装。
方法五:GitHub 直接安装
部分技能支持通过 GitHub 仓库直接安装:
bash
openclaw skills install https://github.com/<author>/openai-whisper搭配推荐
推荐搭配 Skills:
适合人群与行业
- 记者
- 研究员
- 内容创作者
- 学生
应用示例
某记者使用后: 每次采访后直接转录录音,整理时间从 2 小时缩短至 20 分钟,无需上传至第三方服务器。
记者:某记者用 Whisper Skill 每次采访后直接转录录音,整理时间从 2 小时缩短至 20 分钟
⭐⭐⭐⭐⭐ 本地运行完全免费,隐私有保障,转录质量也很高 — 知乎用户
⭐⭐⭐⭐ 会议记录神器,记者必备 — CSDN 用户
常见问题(FAQ)
1. 需要 GPU 吗? 推荐 NVIDIA GPU(至少 4GB 显存),CPU 运行速度较慢。
2. 支持哪些音频格式? 支持 mp3、wav、m4a、ogg 等主流格式。
3. 可以区分说话人吗? Whisper 本身不区分说话人,需配合 pyannote 等工具实现。
缺点与局限性
- 本地算力要求高:需要较强 GPU/CPU 才能流畅运行
- 首次加载慢:large 模型首次加载耗时较长
- 转录速度依赖硬件:长音频转录需要等待
- 无法区分说话人:需要配合说话人分离工具使用
总结
建议指数: 79/100
本地离线语音转文字,隐私安全是最大亮点。不区分说话人是主要限制,建议配合 speaker-diarization 工具使用。
