实时语音识别
识别系统正在播放的声音,并将原文或译文显示为字幕。
实时语音识别页面面向视频、直播、会议和音频内容。它从系统音频中识别语音,可选择将识别结果翻译为目标语言,并通过字幕悬浮窗显示。
使用流程
- 在“设置 > 语音”中下载或导入 ASR 模型。
- 打开本页,选择识别语言和可用识别引擎。
- 需要翻译时,开启翻译并选择目标语言、AI 模型或机器翻译服务。
- 点击开始识别,再开启字幕悬浮窗查看结果。
本页配置
| 配置 | 作用 |
|---|---|
| 音频源 | 选择系统音频,或限定为指定进程,减少其他程序声音干扰。 |
| 识别语言 | 应与音频内容语言一致,以提高识别准确率。 |
| 识别引擎 | 选择已安装的 ASR 模型或可用引擎。 |
| 翻译开关与目标语言 | 控制是否生成翻译字幕及译入语言。 |
| 翻译引擎与模型 | 选择 AI 大模型或机器翻译服务。 |
| 提示词 | 为 AI 语音翻译指定提示词模板。 |
| 实时预览 | 显示尚未最终确认的识别片段。 |
字幕样式、历史数量、自动清理和窗口锁定在“设置 > 语音”中配置。