产品概述
火山语音是火山引擎(字节跳动旗下云服务平台)的语音技术品牌,其文本转语音(TTS)产品在官网以“豆包语音合成大模型”为名上线。该产品依托新一代大模型能力,能够根据上下文智能预测文本的情绪、语调等信息,并生成超自然、高保真、个性化的语音。相比传统TTS,它在口语自然度、连贯性、拟人度、音质、韵律、气口、情感、语气词表达等方面带来更生动、更具情感表现力的听觉体验。
核心能力
语种与方言支持
大模型语音合成方案覆盖中文、英文、日文、西班牙文,并支持台普、北京、广州普、四川、河南、山东普、长沙等方言口音;传统语音合成方案则覆盖中、英、日、葡萄牙、西班牙、泰、越南、印尼等语种及东北、西安、上海、粤语等更多方言口音。
音频输出规格
合成音频采样率支持24K、16K、8K(双向流式接口最高支持48K),输出格式支持pcm、ogg_opus、mp3(wav不支持流式)。
性能与接入方式
在延迟与接入方式上,单向流式/非流式API的流式调用首包耗时约600ms、非流式调用实时率RTF约为0.5,双向流式接口支持逐字级别的输入输出以进一步降低基于大模型的语音交互时延;部署方案为公共云,接入方式包括流式与非流式API、在线SDK、双向流式API及离线SDK。功能上还支持字级别时间戳、语速调整、音调调整、Markdown过滤以及公式播报(LaTeX)等能力。
应用场景
官方文档给出的应用场景包括聊天陪伴(用于豆包等同类对话场景)、有声书合成(可建模笑声、哭腔等副语言现象)、音视频配音、数字人播报(配合口型驱动)以及语音客服等。火山语音团队长期面向抖音、剪映、飞书、番茄小说、Pico等字节跳动业务线以及火山引擎ToB行业提供语音能力,并已覆盖汽车、金融、有声阅读、视频配音等外部企业场景。
声音复刻
与本页“语音克隆”分类对应的是火山引擎的“大模型声音复刻”能力:用户只需在开放环境录制最短5秒的音频,即可在秒级完成对用户音色、说话风格、口音和声学环境音的复刻,几乎无等待时延;每个音色最多可上传训练10次以便低成本调优,2.0版本对高表现力声音(口音、特色音色等)还原度进一步提升。复刻支持跨语种迁移,录制一个语种的声音即可合成中文、英文、日语、西班牙语(墨西哥口音)、葡萄牙语(巴西口音)、印尼语等多个语种。
接入流程
语音克隆的实际接入流程为:在火山引擎控制台开通声音复刻(豆包语音/实时音视频)服务并获取声音ID(speakerid)与API Key,调用训练接口提供一段10-30秒的参考音频来训练音色模型;训练完成后,原声音ID即可直接用于语音合成(TTS)任务,让智能体或数字人以特定人物的声音说话。控制台创建应用后会免费赠送一定数量的音色与训练、合成额度(示例为可进行15次训练并可合成20000字符,具体以控制台为准);预付费音色槽位支持在多个复刻模型间复用,后付费音色槽位费用在首次使用该复刻音色进行语音合成时收取。
模型发布与评测
2025年10月,火山引擎在FORCE LINK AI创新巡展武汉站正式发布豆包语音合成模型2.0(Doubao-Seed-TTS 2.0)与豆包声音复刻模型2.0(Doubao-Seed-ICL 2.0)。两款模型基于豆包大语言模型研发的语音合成新架构,具备更强的语义理解与情感表现力、更精准的指令遵循能力,还能准确朗读复杂公式;用户可通过自然语言实现对语速、情绪、声线、音调、风格的精准调整,目前在小初高全学科复杂公式朗读中的准确率可达90%。
2022年10月,火山引擎语音合成产品获得国家语音及图像识别产品质量检验检测中心(AI国检中心)颁发的语音合成增强级检验检测证书,达到该中心评测体系的最高等级标准;评测覆盖中文普通话、多方言、多语种、混合语种、多音色、个性化等维度,其音色MOS评分最高达4.64分。该产品由火山语音团队自主研发,采用生成式神经网络技术,主要由前端文本分析、声学模型、声码器三大模块构成。
相关导航
数据评估
关于火山语音特别声明
本站深度导航提供的火山语音都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由深度导航实际控制,在2026年9月15日 上午12:15收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,深度导航不承担任何责任。