Capítulo 6 Resultados e Discussão
6.1. Bases de Fala
Os testes realizados neste trabalho utilizaram três bases de fala com o objetivo de avaliar tanto a segmentação realizada pelo algoritmo de Viterbi quanto o sistema baseado em regras para o refinamento da segmentação automática. Através dos testes realizados com as bases foi possível avaliar o sistema quanto à dependência ou não de locutor, avaliar quanto ao sexo do locutor e os parâmetros que afetam a segmentação de fala.
Das três bases utilizadas uma é independente de locutor para o inglês americano (TIMIT) e, as outras duas são dependentes de locutor (uma gravada por um locutor masculino e a outra por um locutor feminino).
6.1.1. Base de Fala Dependente de Locutor Masculino
A base de fala contínua do Português do Brasil, dependente de locutor masculino, é composta por 1226 locuções. Desse total, 1026 locuções são utilizadas para o treinamento dos HMMs e as 200 locuções restantes, diferentes das locuções de treinamento, são utilizadas para teste de segmentação e refinamento.
As locuções foram gravadas por um locutor paulista, do interior do Estado de São Paulo, na ocasião com 29 anos de idade. Por ser considerada uma base pequena, os regionalismos do país e as diferentes pronúncias para algumas locuções não são abordados. Durante a elaboração das frases houve uma preocupação em manter o número médio de ocorrências de cada fone.
Todas as locuções foram capturadas usando uma placa Sound Blaster, amostradas a uma taxa de 22,05 kHz e quantizadas com 16 bits por amostra. Durante a gravação de cada locução houve um cuidado para manter o mínimo de ruído possível. A transcrição de cada locução foi gerada de forma manual, utilizando 39 unidades fonéticas, conforme mostrado na Tabela 4.1. As sentenças gravadas têm uma duração média de 3 segundos e a lista completa encontra-se no Apêndice A.
As locuções do conjunto de teste também foram manualmente segmentadas para a gerar a segmentação de referência utilizada para avaliar a segmentação automática de fala. A segmentação manual foi realizada usando o software livre Praat (www.praat.org), mas não foi feita por um foneticista, e sim pelo próprio autor do trabalho. Cada fronteira foi determinada analisando-se a forma de onda do sinal, o espectrograma, curvas de energia e trajetória de formantes.
6.1.2. Base de Fala Dependente de Locutor Feminino
A base de fala contínua do Português do Brasil, dependente de locutor feminino, foi cedida gentilmente pela empresa VOCALIZE - Soluções em Tecnologias da Fala e da Linguagem Ltda, empresa de base tecnológica incubada na UNICAMP, com o propósito de avaliar a qualidade do sistema de refinamento desenvolvido quando aplicado à fala feminina.
Em comparação com a base dependente de locutor masculino, a base de fala feminina é menor. A base é composta apenas por 100 locuções gravadas por uma locutora feminina, paulista, falante nativa do português brasileiro. A locutora selecionada é musicista, especializada em Canto Popular e Lírico, contando na época da gravação com 29 anos de idade.
A gravação das locuções foi acompanhada por profissionais habilitados, realizada em sala acusticamente tratada. Houve preocupação com a postura da locutora em relação ao microfone e às locuções lidas. Para a gravação foi utilizado também equipamento profissional (M-Box Digidesign, microfone Beringher B2-Pro). As locuções foram amostradas a uma taxa de 22,05 kHz, com resolução de 16 bits por amostra.
A base é foneticamente balanceada e as locuções foram selecionadas do CETENFolha (Corpus de Extractos de Textos Eletrônicos NILC/Folha de São Paulo), disponível no endereço eletrônico http://acdc.linguateca.pt/cetenfolha.
Junto com as locuções também foi cedida pela empresa a transcrição fonética de cada locução e a segmentação manual. Tanto a transcrição fonética quanto a segmentação manual foram realizadas por profissional habilitado, utilizando a representação SAMPA-PB conforme proposta de Morais (Morais et al., 2005).
Como os símbolos da representação SAMPA-PB diferem dos símbolos utilizados neste trabalho, uma alteração foi feita para adaptar as transcrições para o padrão utilizado.
6.1.3. Base de Fala Independente de Locutor (TIMIT)
A TIMIT (Texas Instruments/Massachussets Institute of Technology) é uma base de fala independente de locutor desenvolvida inicialmente com a finalidade de desenvolver e testar sistemas de reconhecimento de fala. Devido ao aumento crescente de pesquisas em diversas áreas de processamento digital da fala, a TIMIT também passou a ser utilizada para testes em segmentação.
Para a confecção da TIMIT foram utilizados 630 locutores, abrangendo os 8 principais dialetos do Inglês Americano. Cada locutor pronunciou 10 locuções, totalizando 6300 locuções foneticamente balanceadas. Desse total apenas 5040 são utilizadas para os testes. Esse conjunto é dividido em locuções de treinamento (3696 locuções) e locuções de teste (1344). É muito importante destacar que do total de locuções de teste, 624 são distintas.
Diferente das locuções das bases de fala dependente de locutor, as locuções da TIMIT foram amostradas a 16 kHz, com uma resolução de 16 bits por amostra. Cada locução do conjunto de treinamento e teste apresenta sua transcrição fonética, a segmentação manual em termos de palavras e também em termos de fones. Essa segmentação manual fornecida será utilizada como referência para avaliar a segmentação automática produzida pelo sistema desenvolvido.
Na transcrição fonética das locuções é utilizado um conjunto de 64 fones distintos. A documentação da TIMIT sugere que apenas 48 fones sejam utilizados no treinamento dos modelos acústicos e sugere ainda que, na fase de teste esse conjunto seja simplificado para 39.
Na Tabela 6.1 são mostrados os fones representativos das plosivas, fricativas, africadas, consoantes nasais e o silêncio. Como pode ser observado na tabela há dois símbolos diferentes para representar o silêncio: silêncio epentético (“epi”), silêncio que é freqüentemente encontrado entre uma fricativa e uma semi-vogal ou nasal (como exemplo a palavra “slow”), e o silêncio prolongado (“sil”), normalmente presente no início, no final e nas pausas das locuções.
Tabela 6.1: Símbolos utilizados na transcrição fonética das plosivas, fricativas, consoantes nasais e silêncio.
Classe Fonética Símbolo Exemplo
Plosiva b bee = vcl b iy Plosiva d day = vcl d ey Plosiva g gay = vcl g ey Plosiva p pea = cl p iy Plosiva t tea = cl t iy Plosiva k key = cl k iy Plosiva dx dirty = vcl d er dx iy Fricativa s sea = s iy Fricativa sh she = sh iy Fricativa z zone = z ow n Fricativa zh azure = ae zh er Fricativa f fin = f ih n Fricativa th thin = th ih n Fricativa v van = v ae n Fricativa dh then = dh e n Nasais m mom = m aa m Nasais n noon = n uw n Nasais ng sing = s ih ng Nasais en button = vcl b ah cl t en Africadas jh joke = vcl jh ow cl k Africadas ch choke = cl ch ow cl k Voiced closure vcl Unvoiced closure cl
Silêncio epentético epi
Silêncio sil
Uma das simplificações sugerida pela documentação da TIMIT é quanto aos símbolos que representam o período de constrição das plosivas (voiced and unvoiced closure). A transcrição original fornecida pela TIMIT utiliza símbolos diferentes para representar o período de constrição de cada uma das plosivas. Por exemplo, para as plosivas surdas [p], [t] e [k] são utilizados os
símbolos “pcl”, “tcl” e “kcl”. Da mesma forma, para as plosivas sonoras [b], [d] e [g], são utilizados os símbolos “bcl”, “dcl” e “gcl”. Segundo a documentação, o período de contrição de todas as plosivas surdas deverá ser representado por “cl” e, das plosivas sonoras, deverá representado por “vcl”.
As outras alterações sugeridas são: os fones “ax-h”, “ux”, “axr”, “em”, “nx”, “eng”, “j”, “hv” e “pau” são substituídos por “ax”, “uw”, “er”, “m”, “n”, “ng”, “jh”, “hh” e “sil”, respectivamente. O fone “q” é removido da transcrição, por sugestão da documentação. Na tabela 6.2 são listados os símbolos utilizados na transcrição fonética das vogais e semi-vogais da TIMIT.
Tabela 6.2: Símbolos utilizados na transcrição fonética das vogais e semi-vogais.
Classe Fonética Símbolo Exemplo
Vogal iy beet = vcl b iy cl t Vogal ih bit = vcl b ih cl t Vogal eh bet = vcl b eh cl t Vogal ey bait = vcl b ey cl t Vogal ae bat = vcl b ae cl t Vogal aa bott = vcl b aa cl t Vogal aw bout = vcl b aw cl t Vogal ay bite = vcl b ay cl t Vogal ah but = vcl b ah t Vogal ao bougth = vcl b ao cl t Vogal oy boy = vcl b oy Vogal ow boat = vcl b ow cl t Vogal uh book = vcl b uh cl k Vogal uw boot = vcl b uw cl t Vogal er bird = vcl b er vcl d Vogal ax about = ax vcl b aw cl t Vogal ix debit = vcl d eh vcl b ix cl t Semi-Vogais l lay = l ey Semi-Vogais r ray = r ey Semi-Vogais w way = w ey Semi-Vogais y yacht = y aa cl t Semi-Vogais hh hay = hh ey Semi-Vogais el bottle = vcl b aa cl t el
Durante a fase de segmentação e teste foram utilizados apenas 48 símbolos diferentes, como sugerido pela documentação da TIMIT. A TIMIT também não faz nenhuma referência às