現(xiàn)聲紋識別:特征提取到模型部署)
簡介聲音作為人體獨(dú)特的生物特征在身份認(rèn)證領(lǐng)域具有天然優(yōu)勢。聲紋識別技術(shù)通過分析語音信號中的頻譜結(jié)構(gòu)、發(fā)音習(xí)慣等細(xì)微差異將說話人身份轉(zhuǎn)化為可計(jì)算的數(shù)字向量從而實(shí)現(xiàn)對“誰在說話”的可靠判斷。從技術(shù)原理上看該過程涉及語音信號預(yù)處理、特征提取如MFCC、Fbank以及深度學(xué)習(xí)模型建模其中嵌入向量Speaker Embedding的質(zhì)量直接決定識別精度。基于深度學(xué)習(xí)的聲紋識別系統(tǒng)在金融支付、智能門禁、會(huì)議紀(jì)要等場景具有廣泛應(yīng)用價(jià)值。本文基于Python和TensorFlow完整實(shí)現(xiàn)了一個(gè)從數(shù)據(jù)準(zhǔn)備、特征工程、ResNet模型訓(xùn)練結(jié)合ArcFace損失到推理部署的聲紋識別系統(tǒng)并分享工程實(shí)踐中的關(guān)鍵細(xì)節(jié)與踩坑經(jīng)驗(yàn)為開發(fā)者提供可運(yùn)行的基線參考。1. 聲紋識別到底在做什么在做這個(gè)項(xiàng)目之前我一直覺得“聲紋識別”是個(gè)挺玄乎的東西。直到我把整個(gè)流程從數(shù)據(jù)準(zhǔn)備到模型部署完整跑通之后才發(fā)現(xiàn)它的核心邏輯其實(shí)非常樸素把人說話的聲音轉(zhuǎn)換成一組數(shù)字向量再拿這組向量去做身份判斷。就像每個(gè)人都有獨(dú)特的指紋一樣每個(gè)人的聲道結(jié)構(gòu)、發(fā)音習(xí)慣、語速節(jié)奏都不一樣這些差異會(huì)體現(xiàn)在語音信號的頻譜特征上而我們要做的就是讓機(jī)器學(xué)會(huì)捕捉這些差異。這個(gè)項(xiàng)目的目標(biāo)很直接用Python和TensorFlow搭建一套能夠區(qū)分說話人身份的聲紋識別系統(tǒng)并且提供完整的源代碼和文檔說明。它要解決的核心問題很簡單——給定一段音頻判斷“這是誰在說話”。聽起來像一個(gè)分類問題但實(shí)際落地的時(shí)候你會(huì)發(fā)現(xiàn)它比普通的圖像分類要復(fù)雜不少。因?yàn)檎Z音是時(shí)序信號長度不固定而且同一個(gè)人的聲音在不同環(huán)境下、不同情緒下、不同設(shè)備錄制下都會(huì)有差異模型要能從這些變化中提取出穩(wěn)定的身份特征這才是聲紋識別的難點(diǎn)所在。我見過不少剛接觸這個(gè)領(lǐng)域的人上來就想著要做一個(gè)“能識別任何人的系統(tǒng)”這個(gè)預(yù)期本身就不現(xiàn)實(shí)。聲紋識別在工程上通常分兩種場景一種是說話人確認(rèn)Speaker Verification也就是驗(yàn)證“這個(gè)人是不是他自稱的那個(gè)人”常用于支付認(rèn)證、門禁系統(tǒng)另一種是說話人辨識Speaker Identification也就是在一堆注冊過的聲音里判斷“這段聲音是誰的”常用于會(huì)議紀(jì)要和角色分離。我們的項(xiàng)目以說話人辨識為主但在推理階段也保留了說話人確認(rèn)的能力這樣一套代碼能覆蓋兩種需求通用性更好。這個(gè)項(xiàng)目適合誰如果你是剛?cè)腴T語音方向的開發(fā)者想用一套相對完整的代碼理解聲紋識別的全鏈路那這個(gè)項(xiàng)目剛好合適。如果你想直接把它用到生產(chǎn)環(huán)境就需要進(jìn)一步調(diào)優(yōu)但至少你能得到一個(gè)可以跑通的基線系統(tǒng)后面的路會(huì)好走很多。1.1 聲紋識別的基本任務(wù)聊到具體任務(wù)之前得先澄清一個(gè)常見誤區(qū)聲紋識別不是“語音識別”。語音識別是把聲音轉(zhuǎn)成文字它的核心是“說了什么”聲紋識別關(guān)注的是“誰在說”也就是聲音里攜帶的身份信息。這兩個(gè)任務(wù)用的特征和模型都可以完全不同雖然它們都處理音頻但目標(biāo)不一樣最終的網(wǎng)絡(luò)結(jié)構(gòu)設(shè)計(jì)思路也會(huì)差很遠(yuǎn)。在說話人辨識任務(wù)下我們要做的其實(shí)是訓(xùn)練一個(gè)多分類模型讓每個(gè)注冊的說話人對應(yīng)一個(gè)類別模型學(xué)會(huì)區(qū)分這些類別。到了推理階段又有變化——新來一個(gè)人要注冊系統(tǒng)但我們在訓(xùn)練時(shí)沒見過他這就需要模型提取出說話人嵌入向量Speaker Embedding然后用向量之間的距離來判斷身份。所以整個(gè)系統(tǒng)的訓(xùn)練思路是先訓(xùn)練一個(gè)分類器但最終我們用的不是分類器的輸出而是它倒數(shù)第二層生成的特征向量。1.2 常用數(shù)據(jù)集與評估指標(biāo)這個(gè)項(xiàng)目里我用了比較經(jīng)典的中文語音數(shù)據(jù)集。這里要提醒一句聲紋識別對數(shù)據(jù)質(zhì)量的要求遠(yuǎn)高于語音識別因?yàn)樯矸萏卣鞅緛砭碗[藏在細(xì)微的頻譜差異里如果數(shù)據(jù)噪聲太大、錄音設(shè)備不一致模型很容易偷懶直接拿信道差異來區(qū)分人而不是真正學(xué)習(xí)聲紋特征。訓(xùn)練集和測試集必須保證說話人不重疊這是聲紋識別領(lǐng)域的鐵律。如果同一個(gè)人的聲音同時(shí)出現(xiàn)在訓(xùn)練集和測試集里那評估結(jié)果就會(huì)虛高完全沒有參考意義。我在做數(shù)據(jù)劃分時(shí)特意檢查了好幾遍確保每個(gè)說話人的音頻只出現(xiàn)在一個(gè)集合里。評估指標(biāo)方面說話人辨識看分類準(zhǔn)確率說話人確認(rèn)看等錯(cuò)誤率EEREqual Error Rate和最小檢測代價(jià)函數(shù)minDCF。EER這個(gè)指標(biāo)衡量的是假接受率和假拒絕率相等時(shí)的錯(cuò)誤率數(shù)值越低代表系統(tǒng)越好。當(dāng)初我跑第一個(gè)baseline模型時(shí)準(zhǔn)確率只有60%左右EER更是慘不忍睹后來一步步調(diào)特征、換網(wǎng)絡(luò)結(jié)構(gòu)、改損失函數(shù)才把指標(biāo)拉到一個(gè)相對能看的水平。這個(gè)過程雖然痛苦但也讓我對這個(gè)領(lǐng)域有了比較深入的理解。2. 特征工程把聲音變成模型能懂的向量在開始搭建網(wǎng)絡(luò)之前必須先把音頻數(shù)據(jù)轉(zhuǎn)換成模型能夠處理的數(shù)值特征。這一步做得好不好直接決定了模型性能的上限。2.1 預(yù)處理采樣率、分幀與加窗原始音頻是一串采樣點(diǎn)比如16kHz采樣率下一秒鐘的聲音就是16000個(gè)數(shù)值點(diǎn)。但在16kHz的采樣率下直接把這些數(shù)值點(diǎn)丟給神經(jīng)網(wǎng)絡(luò)不僅計(jì)算量巨大而且模型很難從原始波形中直接學(xué)到有效的身份特征。所以我們要對音頻進(jìn)行一系列預(yù)處理操作把它轉(zhuǎn)換成更適合模型處理的二維特征圖。第一步是預(yù)加重用的是一個(gè)簡單的高通濾波器公式是y(t) x(t) - α * x(t-1)其中 α 通常取0.97。這么做的目的很樸素語音信號在傳播過程中高頻成分衰減得比低頻快預(yù)加重能把高頻分量補(bǔ)償回來讓頻譜特征更均衡。第二步是分幀。語音信號是時(shí)變的但在極短的時(shí)間段內(nèi)比如20到30毫秒可以看作是平穩(wěn)的。所以我們會(huì)把整段音頻切成一幀一幀的短信號幀長通常取25毫秒幀移取10毫秒也就是說每幀之間有15毫秒的重疊。這樣做的目的是保證幀與幀之間的平滑過渡避免因?yàn)榍械锰槎鴣G失語音的動(dòng)態(tài)信息。第三步是加窗。直接切出來的幀在邊界處會(huì)有截?cái)鄬?dǎo)致頻譜泄漏。解決方法是每一幀乘上一個(gè)漢明窗Hamming Window讓幀的邊緣平滑地衰減到零。這個(gè)過程用librosa庫實(shí)現(xiàn)非常方便但我在項(xiàng)目里選擇了用TensorFlow自帶的信號處理函數(shù)來實(shí)現(xiàn)因?yàn)檫@樣整個(gè)數(shù)據(jù)處理流程可以在訓(xùn)練時(shí)并行處理避免數(shù)據(jù)讀取成為瓶頸。2.2 MFCC與FilterBank特征提取特征選擇上業(yè)界最常用的兩種聲學(xué)特征是梅爾頻率倒譜系數(shù)MFCCMel-Frequency Cepstral Coefficients和FilterBankFbank特征。MFCC的提取流程是分幀加窗后做快速傅里葉變換得到頻譜再通過梅爾濾波器組將頻譜映射到梅爾刻度上然后取對數(shù)最后做離散余弦變換DCT得到倒譜系數(shù)。MFCC的優(yōu)點(diǎn)是去除了部分冗余信息特征維度低在傳統(tǒng)GMM-UBM時(shí)代非常流行。但在深度學(xué)習(xí)時(shí)代Fbank特征用得更多。它的提取流程比MFCC少了一步DCT保留了更多的原始信息。實(shí)踐經(jīng)驗(yàn)告訴我在數(shù)據(jù)量充足的情況下Fbank特征訓(xùn)練出來的模型通常比MFCC效果更好。因?yàn)樯窠?jīng)網(wǎng)絡(luò)有能力自己學(xué)習(xí)特征之間的相關(guān)性我們強(qiáng)行做DCT去相關(guān)反而可能丟掉有用的信息。Fbank特征的維度一般取40維或80維配合一階差分和二階差分可以組成120維或240維的特征。我記得最早訓(xùn)練模型時(shí)只用了靜態(tài)的40維特征模型準(zhǔn)確率卡在70%出頭后來加上差分特征后準(zhǔn)確率直接漲了5個(gè)百分點(diǎn)。原理也不難理解差分特征刻畫了語音的動(dòng)態(tài)變化特性而每個(gè)人的語速節(jié)奏、發(fā)音過渡方式是有差異的這些動(dòng)態(tài)信息對身份識別非常有價(jià)值。2.3 用TensorFlow實(shí)現(xiàn)特征提取在TensorFlow中實(shí)現(xiàn)特征提取有兩種常見方案一是先把音頻離線處理成特征存成numpy數(shù)組或者TFRecord文件訓(xùn)練時(shí)直接讀取二是在訓(xùn)練流程中實(shí)時(shí)提取特征。項(xiàng)目里我選擇了離線方案原因很簡單——特征提取雖然不算復(fù)雜但大量音頻的預(yù)處理依然耗時(shí)離線做完之后訓(xùn)練時(shí)可以完全GPU負(fù)載跑模型不用把時(shí)間浪費(fèi)在CPU特征計(jì)算上。離線提取特征的核心代碼如下import numpy as np import librosa import tensorflow as tf def extract_fbank(audio_path, sample_rate16000, n_fft512, hop_length160, n_mels80): # 讀取音頻并重采樣到16kHz audio, sr librosa.load(audio_path, srsample_rate) # 預(yù)加重 audio np.append(audio[0], audio[1:] - 0.97 * audio[:-1]) # 提取Fbank特征得到 [frames, n_mels] 的二維數(shù)組 fbank librosa.feature.melspectrogram( yaudio, srsample_rate, n_fftn_fft, hop_lengthhop_length, n_melsn_mels ) log_fbank np.log(fbank 1e-6) # 一般還會(huì)做均值方差歸一化讓特征分布更穩(wěn)定 mean np.mean(log_fbank, axis0, keepdimsTrue) std np.std(log_fbank, axis0, keepdimsTrue) log_fbank (log_fbank - mean) / (std 1e-6) return log_fbank.astype(np.float32)這里有個(gè)細(xì)節(jié)值得多說一句特征歸一化。我一開始沒有做歸一化模型訓(xùn)練時(shí)loss下降得很慢而且波動(dòng)很大。因?yàn)椴煌纛l的響度不一樣導(dǎo)致特征數(shù)值范圍差異很大。把每個(gè)樣本的特征做均值方差歸一化之后相當(dāng)于把不同錄音條件下的音量差異抹平了模型學(xué)的就是純粹的頻譜形狀特征訓(xùn)練穩(wěn)定了很多。還要注意一個(gè)是特征長度對齊。不同音頻的長度不同提取出來的幀數(shù)也不同但神經(jīng)網(wǎng)絡(luò)需要固定長度的輸入。常用的辦法有兩種一是將所有音頻統(tǒng)一截?cái)嗷蜓a(bǔ)齊到固定長度比如截取3秒不足3秒的補(bǔ)零二是訓(xùn)練時(shí)用隨機(jī)切片推理時(shí)用整段音頻。項(xiàng)目里我采用的是固定截取的方式但截取位置不是從開頭截取而是先做一個(gè)簡單的VAD語音活動(dòng)檢測找到有效語音段再從有效語音段里取固定長度的片段。這個(gè)操作很關(guān)鍵因?yàn)楹芏嘁纛l開頭有一段靜音如果直接把靜音部分一起送進(jìn)模型不僅浪費(fèi)算力還會(huì)影響特征分布的穩(wěn)定性。3. 網(wǎng)絡(luò)結(jié)構(gòu)與訓(xùn)練策略特征準(zhǔn)備好之后就到了核心環(huán)節(jié)——搭網(wǎng)絡(luò)。這個(gè)環(huán)節(jié)決定了模型能夠從特征中挖出多少身份信息。3.1 網(wǎng)絡(luò)結(jié)構(gòu)選型聲紋識別的網(wǎng)絡(luò)結(jié)構(gòu)經(jīng)歷了從DNN到CNN、再到ResNet和ECAPA-TDNN的演進(jìn)過程。對于基線項(xiàng)目我建議從深層的CNN結(jié)構(gòu)入手因?yàn)樗诰群陀?xùn)練成本之間取得了不錯(cuò)的平衡。我最終采用的是類似ResNet的結(jié)構(gòu)但做了一些針對聲紋任務(wù)的改動(dòng)import tensorflow as tf from tensorflow.keras import layers, Model def conv_bn_relu(x, filters, kernel_size, strides1): x layers.Conv2D(filters, kernel_size, stridesstrides, paddingsame)(x) x layers.BatchNormalization()(x) x layers.ReLU()(x) return x def residual_block(x, filters, strides1): shortcut x x conv_bn_relu(x, filters, 3, strides) x conv_bn_relu(x, filters, 3, 1) if strides ! 1 or shortcut.shape[-1] ! filters: shortcut layers.Conv2D(filters, 1, stridesstrides)(shortcut) shortcut layers.BatchNormalization()(shortcut) x layers.add([x, shortcut]) x layers.ReLU()(x) return x def build_speaker_encoder(input_shape(128, 80, 1), num_classesNone, embedding_dim128): inputs tf.keras.Input(shapeinput_shape) x conv_bn_relu(inputs, 32, 3, 2) x residual_block(x, 32) x residual_block(x, 32) x residual_block(x, 64, 2) x residual_block(x, 64) x residual_block(x, 128, 2) x residual_block(x, 128) # 全局統(tǒng)計(jì)池化把二維特征圖壓成一維向量 x layers.GlobalAveragePooling2D()(x) # 嵌入層得到說話人嵌入向量 embedding layers.Dense(embedding_dim, nameembedding)(x) # 分類層只在訓(xùn)練時(shí)使用 if num_classes is not None: output layers.Dense(num_classes, activationsoftmax, nameclassifier)(embedding) model Model(inputs, output) else: model Model(inputs, embedding) return model這里有一個(gè)關(guān)鍵設(shè)計(jì)值得展開說全局統(tǒng)計(jì)池化Global Average Pooling的作用是把不同長度的特征圖壓成固定長度的向量。有了這一層模型對輸入音頻的長度就不那么敏感了只要在合理范圍內(nèi)長一點(diǎn)短一點(diǎn)都能處理。另外我在主干網(wǎng)絡(luò)里用了Batch Normalization。這個(gè)在聲紋識別里幾乎是必需品——因?yàn)椴煌f話人的特征分布差異可能很大BN能夠讓網(wǎng)絡(luò)每一層的輸入分布保持穩(wěn)定訓(xùn)練過程會(huì)平滑很多。3.2 損失函數(shù)從Softmax到ArcFace最初的baseline模型用的是普通的Softmax損失也就是直接做一個(gè)多分類。訓(xùn)練了50個(gè)epoch之后驗(yàn)證集準(zhǔn)確率大概在78%左右EER在13%上下效果不太理想。問題出在Softmax損失讓模型學(xué)到的特征雖然能區(qū)分訓(xùn)練集里的說話人但這些特征在空間中分布比較松散泛化能力有限。后來我把損失函數(shù)換成了ArcFaceAdditive Angular Margin Loss。這個(gè)損失函數(shù)最初是做人臉識別的但在聲紋識別領(lǐng)域的表現(xiàn)同樣出色。它的核心思想是在Softmax損失的基礎(chǔ)上給目標(biāo)類的角度加上一個(gè)懲罰項(xiàng)margin強(qiáng)迫模型學(xué)到的特征在超球面上聚攏成簇類內(nèi)距離更小、類間距離更大。ArcFace在TensorFlow里實(shí)現(xiàn)并不復(fù)雜核心代碼如下class ArcFaceLayer(layers.Layer): def __init__(self, num_classes, margin0.5, scale32, **kwargs): super().__init__(**kwargs) self.num_classes num_classes self.margin margin self.scale scale def build(self, input_shape): self.w self.add_weight( shape(input_shape[-1], self.num_classes), initializerglorot_uniform, trainableTrue, namearcface_w ) def call(self, inputs, trainingNone): embedding, labels inputs # 歸一化 embedding tf.nn.l2_normalize(embedding, axis1) w tf.nn.l2_normalize(self.w, axis0) # 余弦相似度 cosine tf.matmul(embedding, w) if training: # 將余弦值轉(zhuǎn)換為角度 theta tf.acos(tf.clip_by_value(cosine, -1.0 1e-7, 1.0 - 1e-7)) # 給目標(biāo)類別加上margin one_hot tf.one_hot(labels, self.num_classes) target_logits tf.cos(theta self.margin) logits cosine * (1 - one_hot) target_logits * one_hot return logits * self.scale return cosine * self.scale使用ArcFace有兩個(gè)超參需要注意margin和scale。margin控制的是類間角度的懲罰大小默認(rèn)0.5就夠了設(shè)太大模型會(huì)難以收斂scale是縮放因子一般取32到64之間它控制的是logits的數(shù)值范圍影響溫度。我用的是scale32、margin0.5的組合。訓(xùn)練時(shí)把嵌入向量輸入到ArcFace層再接Softmax交叉熵?fù)p失。這里要特別強(qiáng)調(diào)一點(diǎn)訓(xùn)練集里的說話人數(shù)量決定了分類層的維度但新用戶注冊時(shí)并不會(huì)重新訓(xùn)練模型而是提取嵌入向量存入特征庫然后用余弦相似度做匹配。這也是為什么網(wǎng)絡(luò)要單獨(dú)抽取embedding層的原因。3.3 訓(xùn)練參數(shù)與代碼實(shí)現(xiàn)訓(xùn)練過程中的參數(shù)配置我踩了不少坑這里直接給出一份能用的配置BATCH_SIZE 64 EPOCHS 80 LEARNING_RATE 1e-3 EMBEDDING_DIM 128 NUM_CLASSES 100 # 根據(jù)實(shí)際說話人數(shù)量調(diào)整 # 數(shù)據(jù)生成器 def data_generator(features, labels, batch_size, num_classes): num_samples len(features) while True: indices np.random.permutation(num_samples) for i in range(0, num_samples, batch_size): batch_idx indices[i:ibatch_size] batch_x np.array([features[j] for j in batch_idx]) batch_y tf.keras.utils.to_categorical( [labels[j] for j in batch_idx], num_classes ) yield batch_x, batch_y # 模型與編譯 model build_speaker_encoder( input_shape(128, 80, 1), num_classesNUM_CLASSES, embedding_dimEMBEDDING_DIM ) model.compile( optimizertf.keras.optimizers.Adam(learning_rateLEARNING_RATE), losscategorical_crossentropy, metrics[accuracy] ) # 學(xué)習(xí)率衰減 lr_scheduler tf.keras.callbacks.ReduceLROnPlateau( monitorval_accuracy, factor0.5, patience5, min_lr1e-6 ) early_stopping tf.keras.callbacks.EarlyStopping( monitorval_accuracy, patience15, restore_best_weightsTrue ) model.fit( data_generator(train_features, train_labels, BATCH_SIZE, NUM_CLASSES), steps_per_epochlen(train_features) // BATCH_SIZE, epochsEPOCHS, validation_datadata_generator(val_features, val_labels, BATCH_SIZE, NUM_CLASSES), validation_stepslen(val_features) // BATCH_SIZE, callbacks[lr_scheduler, early_stopping], verbose1 )有兩點(diǎn)經(jīng)驗(yàn)分享一下第一個(gè)是學(xué)習(xí)率。我試過從1e-2開始訓(xùn)練模型很快發(fā)散loss直接變成NaN。后來換成了1e-3初始收斂速度尚可但到了后期就徘徊不前。加上學(xué)習(xí)率衰減調(diào)度之后val_accuracy才有明顯提升。建議不要圖省事跳過學(xué)習(xí)率調(diào)度它能讓模型在訓(xùn)練后期做更精細(xì)的參數(shù)調(diào)整對最終指標(biāo)影響很大。第二個(gè)是Batch Size。受限于GPU顯存我先用了32但訓(xùn)練過程波動(dòng)特別大。后來提升到64訓(xùn)練曲線平滑了很多。如果顯存充裕建議試試128理論上更大batch size能讓梯度估計(jì)更穩(wěn)定。訓(xùn)練完成后需要把模型拆開用encoder Model( inputsmodel.input, outputsmodel.get_layer(embedding).output ) encoder.save(speaker_encoder.h5)這樣保存下來的encoder任何輸入音頻經(jīng)過它都能得到一個(gè)128維的嵌入向量與訓(xùn)練時(shí)的分類層完全解耦。4. 推理、注冊與識別流程訓(xùn)練完模型之后整個(gè)項(xiàng)目的“大腦”已經(jīng)有了。接下來要解決的是工程落地問題如何把模型用起來。4.1 嵌入向量的提取與比對在推理階段系統(tǒng)的核心邏輯是注冊-比對模式。注冊階段每個(gè)說話人提供若干條語音我們通過encoder提取出對應(yīng)的嵌入向量然后算一個(gè)平均向量作為該說話人的“聲紋模板”存入特征庫。識別階段新來一段語音同樣提取嵌入向量然后計(jì)算它與特征庫中每個(gè)模板的余弦相似度相似度最高且超過閾值的那一個(gè)就是識別結(jié)果。余弦相似度的代碼如下def cosine_similarity(vec1, vec2): vec1 vec1 / np.linalg.norm(vec1) vec2 vec2 / np.linalg.norm(vec2) return np.dot(vec1, vec2) def recognize(audio_path, encoder, enrolled_vectors, threshold0.6): feature extract_fbank(audio_path) # [frames, 80] # 如果特征長度不足128幀需要補(bǔ)齊超過則截?cái)嗟?28幀 if feature.shape[0] 128: pad_width 128 - feature.shape[0] feature np.pad(feature, ((0, pad_width), (0, 0)), modeconstant) else: feature feature[:128, :] feature feature[np.newaxis, ..., np.newaxis] # 增加batch和channel維度 embedding encoder.predict(feature, verbose0)[0] best_score -1 best_id None for speaker_id, template in enrolled_vectors.items(): score cosine_similarity(embedding, template) if score best_score: best_score score best_id speaker_id if best_score threshold: return best_id, best_score else: return None, best_score這段代碼是整套系統(tǒng)識別鏈路的最簡實(shí)現(xiàn)。實(shí)際項(xiàng)目里有幾個(gè)地方可以優(yōu)化一是每條語音可以切成多個(gè)片段分別提取嵌入向量然后取平均這樣能大幅提升魯棒性二是特征庫里的模板數(shù)量如果很大需要引入向量檢索比如FAISS否則線性的相似度計(jì)算會(huì)成為瓶頸。4.2 閾值設(shè)置與工程化細(xì)節(jié)閾值的選擇直接決定了系統(tǒng)的“松”和“緊”。閾值設(shè)高了很多真人的聲音會(huì)被拒絕用戶體驗(yàn)差閾值設(shè)低了冒用者的聲音可能被接受安全性無法保障。我建議在實(shí)際項(xiàng)目中先收集一批正樣本對和負(fù)樣本對正樣本對是同一個(gè)人的兩條語音計(jì)算它們嵌入向量的相似度負(fù)樣本對是不同人的兩條語音同樣計(jì)算相似度。然后把所有相似度畫成分布圖選擇能讓正負(fù)樣本重合區(qū)域最小的那個(gè)值作為閾值。如果追求更精確的評估可以在測試集上計(jì)算EER用EER對應(yīng)的相似度作為初始閾值再根據(jù)業(yè)務(wù)安全性要求適當(dāng)上調(diào)。還有一個(gè)容易被忽略的工程細(xì)節(jié)注冊語音的質(zhì)量。注冊時(shí)最好要求用戶錄制多段語音每段3到5秒分別提取嵌入向量后取平均。如果注冊語音環(huán)境噪聲太復(fù)雜模板本身就不準(zhǔn)后面識別再怎么優(yōu)化都白搭。這跟密碼設(shè)置是一個(gè)道理——初始注冊環(huán)節(jié)如果太隨意后續(xù)認(rèn)證的安全性和穩(wěn)定性都會(huì)大打折扣。4.3 模型導(dǎo)出與部署TensorFlow模型訓(xùn)練完成后不能直接把h5格式的模型文件丟給線上服務(wù)還需要做導(dǎo)出和優(yōu)化。項(xiàng)目里我用TensorFlow Serving做了部署# 先保存為SavedModel格式 model.export(saved_model/speaker_encoder) # 啟動(dòng)TensorFlow Serving tensorflow_model_server \ --rest_api_port8501 \ --model_namespeaker_encoder \ --model_base_path$(pwd)/saved_model然后用HTTP請求做推理import requests import json def request_embedding(feature): payload { instances: feature.tolist() } resp requests.post( http://localhost:8501/v1/models/speaker_encoder:predict, jsonpayload ) result json.loads(resp.text) return np.array(result[predictions][0])部署的時(shí)候有個(gè)細(xì)節(jié)TensorFlow Serving對輸入數(shù)據(jù)的shape要求很嚴(yán)格如果客戶端傳過去的特征維度跟模型輸入維度不一致會(huì)直接報(bào)錯(cuò)。所以我在客戶端代碼里加了一層輸入校驗(yàn)寧可讓請求失敗得早一點(diǎn)也不要讓臟數(shù)據(jù)打進(jìn)模型里。如果不想引入TensorFlow Serving這么重的組件也可以用TensorFlow Lite把模型轉(zhuǎn)換成輕量級格式部署到移動(dòng)端或嵌入式設(shè)備上。不過轉(zhuǎn)換過程中要注意算子兼容性問題特別是Batch Normalization層在轉(zhuǎn)換時(shí)有時(shí)會(huì)被折疊一般不會(huì)影響精度但如果發(fā)現(xiàn)轉(zhuǎn)換后結(jié)果異常可以先關(guān)掉混合量化試試。5. 常見問題與排查實(shí)錄這部分我把實(shí)際開發(fā)過程中遇到的高頻問題整理成了一張速查表每個(gè)問題都附上對應(yīng)的解決方案方便大家少走彎路。問題現(xiàn)象可能原因解決方案loss出現(xiàn)NaN學(xué)習(xí)率過高、特征中有NaN值降低學(xué)習(xí)率到1e-4檢查特征提取是否出現(xiàn)log(0)訓(xùn)練集準(zhǔn)確率很高測試集很低說話人重疊或過擬合嚴(yán)格按說話人劃分?jǐn)?shù)據(jù)增加數(shù)據(jù)增強(qiáng)加大Dropout同一個(gè)人不同語音的嵌入向量距離很遠(yuǎn)錄音環(huán)境差異過大收集同一說話人多場景語音提取多個(gè)嵌入向量取平均輸入音頻有大量靜音段時(shí)識別錯(cuò)誤靜音段特征被作為有效語音處理加入VAD預(yù)處理過濾掉靜音幀多人聲音重疊時(shí)識別混亂系統(tǒng)不具備分離多說話人的能力先做說話人分離或改用基于注意力的聚合機(jī)制模型在GPU推理很快CPU上很慢模型本身沒有針對CPU優(yōu)化使用TensorRT或OpenVINO做推理加速或量化模型到INT8新說話人注冊后識別率低注冊語音質(zhì)量差、語音時(shí)長太短至少注冊3條以上語音每條時(shí)長不低于3秒5.1 數(shù)據(jù)類問題數(shù)據(jù)問題往往是最隱蔽的坑。有一次我發(fā)現(xiàn)驗(yàn)證集準(zhǔn)確率一直在60%左右不上不下排查了很久才發(fā)現(xiàn)是數(shù)據(jù)預(yù)處理時(shí)把某些音頻的采樣率搞混了。有的音頻是22.05kHz采樣有的音頻是44.1kHz采樣但特征提取代碼里統(tǒng)一按16kHz去讀導(dǎo)致這些音頻被重采樣后頻率信息失真特征質(zhì)量一塌糊涂。后來我在數(shù)據(jù)讀取那里加了一個(gè)斷言確保所有音頻的原始采樣率符合預(yù)期問題才徹底解決。還有一個(gè)常見問題是數(shù)據(jù)不平衡。比如訓(xùn)練集里A說話人有100條語音B說話人只有20條模型就會(huì)傾向于把更多樣本的類別預(yù)測得更準(zhǔn)少數(shù)類說話人的識別率明顯偏低。解決辦法一是對少數(shù)類做過采樣也就是重復(fù)采樣少數(shù)類的音頻片段二是使用加權(quán)損失函數(shù)讓少數(shù)類別在計(jì)算loss時(shí)獲得更高的權(quán)重。這兩種方法我都試過過采樣簡單粗暴但效果不錯(cuò)加權(quán)損失函數(shù)理論上更優(yōu)雅但需要調(diào)權(quán)重參數(shù)性價(jià)比不如過采樣。5.2 訓(xùn)練類問題訓(xùn)練過程中最讓人崩潰的不是模型不收斂而是模型在訓(xùn)練集上表現(xiàn)很好、驗(yàn)證集上卻一塌糊涂。這事我經(jīng)歷過好幾次。第一次遇到時(shí)我懷疑是模型結(jié)構(gòu)有問題換了好幾種結(jié)構(gòu)都不見起色。后來才意識到是數(shù)據(jù)泄露——我用的數(shù)據(jù)集里同一個(gè)說話人的不同音頻可能在共享一個(gè)錄音環(huán)境比如都是同一個(gè)時(shí)間、同一個(gè)房間里錄的模型巧妙地學(xué)到了“環(huán)境特征”而不是“身份特征”。這種情況下再怎么換模型結(jié)構(gòu)都白搭必須重新審視數(shù)據(jù)本身。另一種訓(xùn)練問題時(shí)梯度爆炸。如果你用的是深層的CNN而且沒有加Batch Normalization訓(xùn)練到一半loss突然變成NaN的可能性很大。我的建議是網(wǎng)絡(luò)里每一層卷積之后都接BN尤其是深層網(wǎng)絡(luò)它不僅可以緩解梯度爆炸還能提升模型的收斂速度。另外梯度裁剪也是一個(gè)保險(xiǎn)手段optimizer tf.keras.optimizers.Adam(learning_rate1e-3, clipnorm1.0)設(shè)置clipnorm1.0表示梯度的L2范數(shù)最大為1超過部分會(huì)被縮放可以有效避免梯度爆炸。5.3 推理類問題推理階段最容易踩的坑是輸入特征長度不一致。TensorFlow的模型是靜態(tài)圖輸入張量的shape在模型保存時(shí)就固定了。所以如果訓(xùn)練時(shí)輸入是128幀推理時(shí)傳進(jìn)來300幀模型會(huì)直接報(bào)錯(cuò)。我前面代碼里對特征做了截?cái)嗪脱a(bǔ)齊正是為了應(yīng)對這個(gè)問題。但要注意把長音頻硬截?cái)嗟?28幀會(huì)丟失后面大部分信息所以更好的辦法是——訓(xùn)練時(shí)就把輸入長度設(shè)置得足夠大比如200幀推理時(shí)如果音頻超過這個(gè)長度就從中間截取一段特征最豐富的片段。還有一個(gè)很隱蔽的問題特征歸一化參數(shù)的保存與加載。如果你在訓(xùn)練時(shí)對特征做了均值方差歸一化歸一化的均值和方差是從訓(xùn)練集統(tǒng)計(jì)出來的那推理時(shí)用的也必須是同一組參數(shù)而不能對每條測試語音單獨(dú)計(jì)算均值和方差。我當(dāng)時(shí)就犯過這個(gè)錯(cuò)測試音頻單獨(dú)歸一化之后嵌入向量的分布跟訓(xùn)練時(shí)的特征分布對不上識別準(zhǔn)確率直接掉了一半。正確的做法是把訓(xùn)練集的均值和方差保存到本地文件推理時(shí)讀取并復(fù)用。6. 踩坑心得與后續(xù)擴(kuò)展方向整個(gè)項(xiàng)目做下來我對聲紋識別有了幾個(gè)比較深的體會(huì)。第一個(gè)體會(huì)是聲紋識別系統(tǒng)的上限由數(shù)據(jù)質(zhì)量決定模型結(jié)構(gòu)只是決定你能多接近這個(gè)上限。如果數(shù)據(jù)里充斥著噪聲、回聲、設(shè)備差異任何精妙的模型都很難發(fā)光。所以做這個(gè)方向花在選擇和處理數(shù)據(jù)上的時(shí)間絕對值得。第二個(gè)體會(huì)是不要迷信復(fù)雜的模型。一開始我想直接上ECAPA-TDNN這種當(dāng)前最先進(jìn)的網(wǎng)絡(luò)結(jié)構(gòu)但訓(xùn)練起來超參調(diào)整復(fù)雜小數(shù)據(jù)量上還容易過擬合。后來老老實(shí)實(shí)從ResNet基線做起反而在有限的數(shù)據(jù)上拿到了更好的指標(biāo)。先把簡單模型做到極致再考慮升級模型這是最穩(wěn)妥的節(jié)奏。第三個(gè)體會(huì)是聲紋識別不是萬能的。它的本質(zhì)是在概率層面做判斷受環(huán)境、情緒、身體狀況影響很大。比如一個(gè)人感冒了聲音跟平時(shí)會(huì)有明顯差異識別準(zhǔn)確率大概率下降。這并不意味著系統(tǒng)不行而是聲紋本身的特性決定了的。在產(chǎn)品設(shè)計(jì)時(shí)聲紋識別適合做多因素認(rèn)證中的一環(huán)而不是唯一的身份憑證。后續(xù)如果想繼續(xù)擴(kuò)展可以考慮幾個(gè)方向一是引入數(shù)據(jù)增強(qiáng)通過加噪、變速、音調(diào)變化等方式擴(kuò)充訓(xùn)練樣本提升模型的泛化能力二是嘗試自監(jiān)督預(yù)訓(xùn)練先在大規(guī)模無標(biāo)注語音數(shù)據(jù)上預(yù)訓(xùn)練再在聲紋任務(wù)上微調(diào)這是目前語音領(lǐng)域的趨勢三是把模型結(jié)構(gòu)升級為ECAPA-TDNN或基于Transformer的結(jié)構(gòu)同時(shí)配合ArcFace和更豐富的數(shù)據(jù)增強(qiáng)策略把EER指標(biāo)再往下壓一壓。最后再分享一個(gè)小技巧在模型訓(xùn)練完成后不妨把你的測試語音畫成嵌入向量的二維投影圖用t-SNE降維看看能不能清晰區(qū)分不同的說話人。如果投影結(jié)果里同一個(gè)說話人的點(diǎn)分散在不同地方說明模型還沒學(xué)到穩(wěn)定的身份特征如果不同說話人的點(diǎn)混在一起說明類間區(qū)分度不夠。這個(gè)可視化步驟雖然簡單但能幫你快速判斷模型的瓶頸在哪里比盯著loss曲線直觀得多。本文還有配套的精品資源點(diǎn)擊獲取