作者:互联网 时间: 2026-09-01 19:12:53
录音开头话术需含声母、韵母、声调、轻声词和儿化音;禁用专业术语;手机直录禁用降噪,USB麦需Audacity降噪后导出16/48kHz WAV;发声须坐直、语速3~4字/秒、停顿2秒、重复3遍。
用讯飞智作做声音复刻时,录音开头那几秒的话术内容和录制质量,直接决定AI能否准确提取你的声纹特征——录错一句,模型就可能把“啊”听成“呃”,把降调当成升调,后续所有配音都会失真。
第一句必须是完整、自然的普通话短句,例如:“今天天气不错,我们开始录制声音。”【不能只念单字、拼音或数字】
这句话要同时覆盖:声母(如“天”“不”)、韵母(如“气”“始”)、声调(四声全有)、轻声词(如“我们”里的“们”)和常见儿化音(如“一会儿”)。缺一类,AI建模时就会在对应发音环节掉精度。
避免使用专业术语、英文缩写、生僻字。讯飞智作当前版本对“GDP”“iOS”“熵”等词的音素切分仍不稳定,容易导致声学特征提取断裂。
方法一:手机自带录音App直录
打开手机「备忘录」或「语音备忘录」,选“高质量”模式(iOS需开启“高保真录音”,安卓部分品牌需进设置→录音质量→选“48kHz/24bit”)。【禁用降噪模式】——讯飞智作的声纹建模依赖原始呼吸声、轻微气流声等副特征,主动降噪会抹掉这些关键线索。
方法二:USB电容麦+Audacity精修
先录30秒环境底噪(空录5秒),再录话术;导入Audacity后,用“效果→噪声抑制”仅处理底噪,保留人声本底动态。导出为WAV格式,采样率必须为16kHz或48kHz,其他值上传后系统会报错拒绝识别。
第一步:坐直,下巴微收,保持口腔自然张开状态,不要刻意放大口型。
第二步:语速控制在每秒3~4个字,比日常说话慢15%,确保每个字的韵尾(如“好”的“o”、“去”的“u”)充分释放。
第三步:说完后停顿2秒再结束录音,留给AI截取静音段作为声学边界参考。
第四步:同一句话重复录3遍,系统将自动比对并选取最优片段建模——如果3遍中有一遍出现明显吞音、破音或突然咳嗽,该次整条录音即被弃用。