远程与设置

语音输入

NomiFun 支持在首页和会话输入框中直接录音转文字。你可以选择已经配置的云端语音模型,也可以下载本地 ASR,让音频在自己的设备上完成识别。

语音输入与语音识别设置

选择识别方式

打开侧边栏“模型管理”,进入“语音转文字”。

使用本地 ASR

  1. 点击“管理本地 ASR”。
  2. 在“语音识别”目录中选择模型:
    • FunASR Paraformer 中文版:更适合以中文为主的输入;
    • Whisper Small:体积较小,适合先体验多语言识别;
    • Whisper Large v3 Turbo:模型更大,适合更看重识别质量的多语言场景。
  3. 点击安装,等待模型和运行组件下载完成。
  4. 将安装好的模型设为当前启用模型。
  5. 回到“语音转文字”,选择本地模型并打开语音输入开关。

本地模型会占用磁盘空间,安装页会显示每个模型的下载大小。你可以随时停用或删除不再使用的模型。

使用云端语音模型

  1. 先在“模型服务”中添加支持语音识别的 Provider 与模型,例如 OpenAI 兼容的 Whisper 或 Deepgram Nova。
  2. 回到“语音转文字”,从来源列表选择对应 Provider 与模型。
  3. 设置默认语言提示并启用语音输入。

云端方式会把录音发送给你选择的 Provider;具体数据处理规则以该服务商的条款为准。

在会话中录音

配置成功后,输入框旁会出现麦克风按钮:

  1. 点击麦克风开始录音;首次使用时允许系统的麦克风权限。
  2. 界面会显示录音时长与波形,再次点击即可停止。
  3. NomiFun 完成转写后,会把文字追加到输入框,而不是直接发送。
  4. 检查并修改文本,再像普通消息一样发送。

首页与进行中的会话都可以使用同一套语音输入配置。

常见问题

没有看到麦克风按钮。 说明还没有可用的语音来源,或语音输入开关未启用。回到“模型管理 → 语音转文字”检查选择。

本地模型安装后仍不可选。 确认下载已完成,并在本地 ASR 页面将该模型设为启用。若刚更新应用,重新打开模型管理以刷新状态。

录音没有声音。 在系统隐私设置中允许 NomiFun 使用麦克风,然后重新开始录音。

中文识别不理想。 优先尝试带“中文推荐”标记的 FunASR;多语言场景可改用 Whisper Large v3 Turbo。

相关

完整源码与发布记录 → GitHub