一、离线TTS方案概述
基于启英泰伦CI1302/CI1303/CI1306的离线 TTS 基于深度神经网络技术,无需网络,依靠串口协议,把文本实时转换成清晰自然流畅的语音;支持语速、语调、音量、音色、情绪多项参数配置。

二、核心优势
合成体验佳:单次最大可合成 4K 字节文本
听感舒适:播报音色流畅自然
方案成熟:支持任意中文文本语音合成
智能文本处理:自动解析处理数字、电话号码、日期时间、度量衡符号;多音字、数字、时间、字母均可正确朗读
附加能力:离线任意文本转语音,支持内置少量播放音频
三、方案框架及工作流程
输入端:MCU、PC、安卓设备,通过UART 串口下发文本
核心芯片:CI1302/CI1303/CI1306,接收串口协议完成语音合成
输出链路:CI1302 → PA 功放 → 扬声器播放音频
四、控制能力
通过串口下发协议指令,可实现:
播放控制:开始、暂停、继续、停止播报
参数调节:音量、语速、音调调整

五、功能描述
1、文本合成功能
支持任意中文汉字(不支持繁体字,生僻字)文本合成,英文按单个字母发音。文本编码支持GB2312,单次合成文本量不超过4K字节。
2、文本分析功能
智能解析常见标点符号,常见多音字、数字。支持常用英文单位(需小写)、特殊数字发音。单句无停顿标点符号句子长度超过50字将自动切断。
3、支持音量、语速、语调调整
支持10级音量、10级语速、10级语调调整。
发送协议头+[v0]-[v9],音量由小到大。默认为中间值。
发送协议头+[s0]-[s9],语速由快到满,默认为中间值正常语速。
发送协议头+[t0]-[t9],语调由低到高,默认为中间值正常语调。
4、支持单发音人,可根据需求定制
5、支持文本标记,可标记多音字发音、数字发音、短停顿
多音字标记方式:
[=*] 标记前一汉字的拼音
例:空调[=tiao2]调[=tiao2]到三十度
汉字拼音解析为:kong1 tiao2 tiao2 dao4 san1 shi2 du4
其中,拼音格式为拼音+声调,声调数值范围1-5,分别代表(1:阴平 2:阳平 3:上声 4:去声 5:轻声)。拼音中ü用字母v代替,字母均为小写。
数字标记方式:
[n*],指定该标记后的数字发音方式,*为1时按数字发音,*为2时按数值发音,*为3时按电话号码格式发音。该标记后必须跟数字才能有效转换。
例:共消费[n2]100元,请拨打电话[n1]95511,手机号码[n3]18812341121。
解析为:共消费一百元,请拨打电话九五五一一,手机号码幺八八幺二三四幺幺二幺。
短停标记方式:
[w0],指定该位置做短暂停顿。
例:欢迎使用[w0]我司的语音合成系列方案。
6、支持控制指令
开始合成,暂停合成,继续合成,停止合成,查询芯片状态。
7、支持15种提示音效,其中:铃声 5 首; 信息提示音 5 首;警示音 5 首。¶
| 类型 | 提示音名称 | 提示音名称 | 提示音名称 | 提示音名称 | 提示音名称 |
|---|---|---|---|---|---|
| 铃声 | ring_1 | ring_2 | ring_3 | ring_4 | ring_5 |
| 信息提示音 | message_1 | message_2 | message_3 | message_4 | message_5 |
| 警示音 | alert_1 | alert_2 | alert_3 | alert_4 | alert_5 |
提示音使用方法:发送协议头+提示音名称,则播报对应提示音名称的音频。
六、配套开发资料
| 资料类型 |
|---|
| 芯片手册 |
| 模块手册 |
| 开发板手册 |
| SDK 开发包 |
| 开发说明文档 |
七、CI1302 离线 TTS方案 应用场景
核心特点:完全离线、UART 串口对接 MCU、动态文本实时播报,不需要提前预录语音文件,弱网 / 无网环境稳定工作
1、政务商业终端
排队叫号系统:医院、政务大厅、银行、门店叫号;播报排队号、窗口号、业务提示,动态生成播报内容。
考勤门禁终端:指纹 / 刷卡考勤机,播报工号、姓名、打卡时间、迟到提醒;门禁播报访客信息、状态提示。
自助设备:自助售货机、查询终端、取件柜;播报操作指引、故障提示、取件码、金额信息。
2、教育与智能玩具
早教故事机、教育机器人、互动玩偶:动态文本转语音,不限故事内容,问答互动,不用大量预存音频文件。
益智教具、点读类设备:朗读文字、数字、英文,教学语音反馈。
3、智能家居 & 小家电
智能面板、茶吧机、电饭煲、风扇、浴霸、智能门锁等;播报工作状态、故障告警、操作反馈、定时提醒。
优势:很多家电没有 Wi‑Fi,离线 TTS 直接串口接主控 MCU 即可实现语音播报。
4、交通车载
公交 / 班车报站器:播报站点、提示语。
车载简易导航、车载告警设备:播报提示文字、限速、告警信息,网络差时依然可用。
OBU、停车场扣费终端,播报扣费金额等动态信息。
5、工业设备
工业控制器、检测仪器、PLC 配套模块;播报设备状态、报警代码、测量数值、故障信息。
CI1302 工业温度范围‑40℃~+85℃,可以适应工业环境。
6、康养与穿戴设备
老人提醒器、健康监测设备;播报测量数据(血压、心率)、定时吃药提醒、告警提示。
7、创客 / 二次开发
AI Agent 硬件、嵌入式开发板;MCU / 单片机通过 UART 下发文本,实现设备语音输出,适合 DIY 硬件、竞赛项目。
八、同类离线 TTS方案对比
CI1302 vs SYN6288 vs XFS5152 离线 TTS 简明对比表
说明:SYN6288 原厂已停产,市面多为存量 / 仿制模块;CI1302 为启英泰伦 AI 芯片,TTS 只是其中一项能力,芯片同时支持离线语音识别。
| 对比项目 | CI1302(启英泰伦) | SYN6288(宇音天下) | XFS5152(科大讯飞) |
|---|---|---|---|
| 合成技术 | DNN 神经网络 TTS | 波形拼接 TTS(传统) | 拼接式 TTS |
| 产品状态 | 量产在售 | 原厂停产,市面模块多为兼容版 | 量产在售 |
| 通信接口 | UART 串口;I2S、PDM、GPIO 丰富外设 | 仅 UART 串口 | UART、I2C |
| 单次最大合成文本 | 4KB 字节文本 | 200 字节(约 100 汉字) | 约 250 字节 |
| 音色 / 情绪 | 多音色可选;支持语速、音量、语调、情绪调节 | 2 种音色(男女);语速音量可调,无情绪 | 多音色,语速音量语调可调 |
| 文本智能解析 | 数字、时间、号码、度量衡、多音字、英文混读 | 数字、时间、号码、度量衡、多音字处理 | 数字、时间、多音字、中英文混读优秀 |
| 音频输出 | 内置 Codec,DAC/I2S/PWM,信噪比高 | DAC 模拟输出,底噪偏大,需外围滤波 | DAC/I2S 输出 |
| 附加能力 | ✅自带离线语音识别、唤醒、降噪;一颗芯片同时做识别 + TTS 播报 | ❌仅 TTS,无识别能力;内置少量提示音和弦音 | ❌仅 TTS,无识别能力 |
| 工作温度 | -40℃ ~ +85℃工业级 | ‑20℃~+70℃ | ‑40℃~+85℃工业级 |
| 封装 | SSOP24(8.6×6.0mm) | SSOP28(10.2×5.3mm) | QFN32 |
| 开发资料 | 芯片手册、模块手册、SDK、开发板全套提供 | 模块资料多,原厂芯片资料较少 | 完整 SDK、模块资料 |
| 典型优势 | 一颗芯片搞定离线识别 + TTS;长文本播报;听感自然;工业温度;外设丰富 | 行业经典老方案,大量旧项目沿用,驱动代码网上资源极多 | TTS 听感行业标杆,中英文混读表现优秀 |
| 短板 | 如果项目只需要纯 TTS 不需要语音识别,芯片资源有冗余 | 原厂停产,新设计不推荐;单次文本短;音色少,老拼接听感机械;底噪高 | 价格偏高;不具备离线语音识别能力 |
| 适合场景 | 家电、工业终端、门锁、玩具,同时需要语音唤醒识别 + 播报的产品;无网嵌入式设备 | 存量老设备维护;低成本简单播报,新项目尽量避开 | 对 TTS 音质要求高,只做播报,不需要语音识别的设备 |
选型快速建议
新项目,既要语音识别唤醒,又要 TTS 播报 → 优先选 CI1302,单芯片完成识别 + 播报,BOM 精简。
老项目维护、复用旧代码:才继续用 SYN6288;全新硬件设计不建议选型,原厂已停产供货风险大。
如果设备全部是固定几句提示音,不需要动态文本播报:优先选预录语音芯片(SMP37A, 量大只0.xx),成本会比 TTS 芯片更低。
总结
CI1302 是一款串口驱动的离线中文语音合成芯片,不上网也能做文本转语音,自带文本智能纠错解析,支持播放控制和语音参数调节,提供全套芯片、模块、SDK 开发资料,适合嵌入式设备做语音播报。

参考资料
启英泰伦AI语音芯片离线语音识别IC列表选型指南_选择指南_SUNSHINE SILICON
CI1301 CI1302 CI1303高性能神经网络智能语音识别芯片 BNPU_电子元件_SUNSHINE SILICON
