Fish Audio
产品
产品
产品概览
探索一体化创作套件
声音库
适用于任意角色的音色
创建
文字转语音
生成拟人化 AI 语音
多人对话
为多角色剧本生成对话音频
语音转文字
转录音频和视频
声音设计
生成专属音色
变声器
用任意音色输出音频
人声分离
提取清晰语音
语音克隆
克隆你的声音
音效
即将上线
生成任意声音
配音
即将上线
本地化音频内容
音乐
即将上线
将创意变成歌曲
图片
文本生成图片
视频
用文本或图片生成视频
S2
Fish Audio S2.1 Pro
支持多说话人、多轮生成,并可通过自然语言描述控制声音表现。
API
平台
概览文档API 参考文档API 密钥API 价格API 调试台
API
文字转语音
通过 API 生成语音
音乐
即将上线
通过 API 创作歌曲
语音转文字
批量转录语音
音效
即将上线
通过 API 生成音效
实时语音转文字
实时转录语音
语音克隆
克隆音色用于 TTS
语音引擎
即将上线
让智能体具备语音能力
智能体
即将上线
几分钟内部署语音智能体
配音
即将上线
通过 API 翻译视频和音频
API
Fish Audio API 快速开始
在线调试语音生成、转写与账户密钥
文字转语音
将文本转为自然流畅的语音,多模型可切换
语音转文字
高精度音频转文字,支持多语种
声音克隆
短样本一键克隆声音
配音广场
浏览公开音色并选择参考声线
AI 图片
提示词生成高质量图像
AI 视频
文字描述生成视频与风格
数字人 / 对口型
音画同步,适用于虚拟人与讲解
工作台
语音合成工作台,创建和管理您的配音项目
短视频与配音
适合社媒、广告与信息流内容
有声书与播客
长文本朗读与自然停顿
教育与培训
课程讲解与企业内训话术
公司
关于博客
资源
Coze
Tavo
SillyTavern
Dify
Open WebUI
AnythingLLM
Home Assistant
n8n
推广伙伴计划
即将上线
API 在线调试
在线试用 REST 接口与示例请求
API 密钥
在账号中心创建与管理 API 密钥
价格
TTS 模型指南2026-03-19·6 分钟阅读

小米 MiMo-V2-TTS:文本驱动的高表达 TTS

从自由文本风格指令到非语言事件与演唱能力:MiMo-V2-TTS 把“表达”做成了真正的语音生成能力。

查看官方介绍 →去 API Playground 看请求示例 →

为什么 MiMo 不只是传统 TTS?

自由文本风格指令

用自然语言描述情绪、语速、音色质感与表演意图;模型会把描述解析为生成方式。

上下文情绪与韵律推断

不只是“贴标签”,而是根据文本语义与语境调整语调、节奏与表达。

非语言事件更自然

停顿、犹豫、叹气、咳嗽、笑声等“表演层信息”可以融入生成过程。

同一模型支持演唱

官方强调具备演唱/唱歌能力,并在同一模型中完成说话与唱歌生成。

如果你的站点核心是“配音工作流”,那么 MiMo 的价值就在于:你可以把“情感与表演细节”写进文本,而不是依赖下拉框。

如何写风格指令(可直接复用到你的工作流)

建议你把风格描述拆成三块:情绪/语速/表演强度 + 声音质感 +(可选)非语言事件。

快速示例

生气:语速偏快,试图压住怒火;多一点短停连与呼气;句末不要爆发。

耳语/轻声

悄悄话:贴近耳语,语速慢,声音更轻;带轻微停顿与“短促笑一下”(不夸张)。

加入非语言事件

我就知道……(长叹一口气)你又把事情搞砸了。(停顿两秒)不过没关系,我们重新来。

把这些指令作为你站内“风格模板”。当你未来接入 MiMo 时,只需要把模板映射到 MiMo 对应的字段或控制方式即可。

接入/产品化:我们建议的映射思路

1) 新增 MiMo 作为 provider/model

在你的模型配置中增加 `provider=mimo`(以及对应的模型标识),让用户可以从模型选择器中选中 MiMo。

2) 把“自由风格指令”统一成你的输入字段

如果你现在已经有 `emotion/language/speed/volume`,就用“拼接策略”生成 MiMo 的风格描述;或者新增一个“stylePrompt”字段走直通逻辑。

3) 在计费/配额里按可用字符与任务大小治理

不同 provider 的生成成本不同。建议先按字符长度或估算时长建立计费系数,再根据实际生成结果逐步校准。

4) 用 FAQ/示例降低学习成本

SEO 流量进入后,最重要的是“可复制的写法”。在页面给出可用示例、标记解释与常见问题。

FAQ

MiMo-V2-TTS 的风格控制方式是什么?

它强调用“自由文本风格指令”来描述语音的情绪、语速、音色质感和表演方式,而不是只选一个固定的情绪标签。

它能生成停顿、呼吸、咳嗽、笑声等非语言事件吗?

官方页面展示了用文本标记来引导停顿、犹豫、叹气、咳嗽、笑声等非语言事件,从而让语音更自然、更有表演张力。

MiMo-V2-TTS 支持演唱/唱歌能力吗?

官方介绍它具备演唱/唱歌合成能力,并且在同一模型中完成说话与演唱生成。

鱼声配音工具站什么时候支持 MiMo-V2-TTS?

我们正在规划 provider 对接、字段映射与计费/额度治理。建议你关注文档与更新公告;同时你也可以先把本文的“风格指令写法”用于构建自己的 prompt 规范。

相关入口

风格指令模板 →非语言事件写法 →演唱能力与用例 →API Playground →文字转语音工具 →声音克隆教程 →

产品

  • 文字转语音
  • 多人对话
  • 语音转文字
  • 声音设计
  • 变声器
  • 人声分离
  • 声音克隆
  • 音效即将上线
  • 配音即将上线
  • 音乐即将上线
  • 图片
  • 视频

解决方案

  • 短视频与配音
  • 有声书与播客
  • 教育与培训

研究

  • Fish Audio S1
  • Fish Audio S2 Pro
  • Fish Audio S2.1 Pro

资源

  • 文档
  • API 参考文档
  • 模型库
  • 声音克隆教程
  • 产品对比

公司

  • 关于
  • 博客
Kitta AudioPowered by Fish Audio
© 2026 Kitta AI。保留所有权利。|隐私政策|服务条款|举报滥用|support@fishaudio.org
support@fishaudio.org

Kitta Audio 由 Kitta AI 独立运营,非 Fish Audio 官方服务。