• Nenhum resultado encontrado

3. Sistemas de Tradução Automática Estatística

3.2. Modelo de tradução

3.2.2. Modelos de tradução baseados em phrases

Tal como acima mencionado, nem sempre as palavras são a melhor unidade para tradução.

O João leu o livro novo. John read the new book.✓

O João leu o livro de novo. John read the book of new. X

O João leu o livro de novo. John read the book again.✓49

Atualmente, os sistemas de TAE com melhor desempenho são baseados em modelos de phrases, ou seja, unidades formadas por grupos de palavras sem motivação linguística (ibidem: 127). Segundo Koehn (ibidem: 127-129), estes modelos suprem as lacunas dos modelos de tradução baseados em palavras na medida em que:

a) as palavras nem sempre são as melhores unidades para tradução, uma vez que uma palavra f pode corresponder a mais do que uma palavra e e vice-versa; b) traduzir grupos de palavras pode ajudar a resolver ambiguidades de tradução; c) com um corpus grande é possível “aprender” phrases úteis cada vez mais

longas, até a tradução de frases inteiras;

41 d) este modelo é concetualmente muito mais simples, dispensando noções como

fertilidade, inserção e eliminação.

Tal como nos modelos IBM orientados à palavra, também as frases são decompostas em unidades menores, neste caso phrases. Os pares de phrases podem ser extraídos a partir de alinhamento de palavras (e neste caso, os pares de phrases selecionados têm de ser consistentes com o alinhamento das palavras) ou diretamente a partir do corpus50. Na extração de pares de phrases para a criação de uma tabela de tradução de phrases é necessário, antes de mais, realizar o alinhamento entre as palavras do par de frases (ibidem: 130). Para extrair pares de phrases a partir de alinhamentos de palavras é necessário que haja consistência nos alinhamentos das palavras, ou seja, que todas as palavras f na frase F tenham um ponto de alinhamento com palavras e na frase E e vice- versa (ibidem: 131). No caso de palavras não-alinhadas, estas tanto podem ocorrer no meio como nas extremidades de uma phrase (ibidem: 132).

Figura 10 – Todas as palavras devem estar alinhadas umas com as outras. No segundo exemplo, existe uma inconsistência porque há um ponto de alinhamento que se encontra fora do par de phrases (Koehn, 2010: 132).

Vejamos o seguinte exemplo51:

peter has come back home .

o Pedro regressou a casa .

50 Este último método de aprendizagem de extração de pares de phrases não será objeto de análise neste trabalho, uma vez que, tal como referido por Koehn (2010: 148), este tipo de aprendizagem é limitado a pequenos corpora e não apresenta melhores resultados do que o método de extração de phrases através do alinhamento de palavras. 51 Exemplo baseado em España (2011: 124).

42 Dado o alinhamento à palavra entre a frase inglesa (f) e a respetiva tradução em português (e), seria possível extrair 14 phrases: (Peter, Pedro) (Peter, O Pedro), (Peter has come back, O Pedro regressou), (Peter has come back, O Pedro regressou a) (Peter has come back home, O Pedro regressou a casa), (Peter has come back home., O Pedro regressou a casa.), (has come back, regressou), (has come back, regressou a) (has come back home, regressou a casa), (has come back home., regressou a casa.), (home, casa), (home, a casa), (home., a casa.), (.,.)

Segundo Koehn (ibidem: 131), para cada par de frases, é extraído um conjunto de pares de phrases, que tanto podem ser mais longas ou mais curtas, uma vez que tanto umas como outras podem ser úteis. Phrases mais curtas têm probabilidade de serem utilizadas com maior frequência, podendo ser aplicáveis a frases nunca antes vistas (como, por exemplo, home, casa); phrases mais longas, embora menos frequentes, ajudam a captar mais contexto local e, como tal, ajudam a traduzir trechos mais longos de uma só vez (como por exemplo, has come back, regressou).

Tal como as palavras numa frase, também as phrases sofrem alterações de posição de uma língua para outra. Koehn (ibidem: 142-145) refere duas formas de proceder à reordenação de phrases na transição de um enunciado de uma LP para uma LC: através do estabelecimento de limites para essa reordenação ou de uma reordenação lexicalizada.

Num modelo em que são estabelecidos limites para a movimentação dos elementos de uma frase na LP para uma LC, a mudança de posição é normalmente punida e apenas é justificada pelo modelo de língua (ibidem: 142). Este tipo de modelo de reordenação é utilizado com modelos de língua pequenos (por exemplo, trigramas, ou seja, históricos baseados em três palavras) em que não é possível extrair muita informação para se formarem juízos adequados acerca da gramaticalidade geral de uma frase (ibidem). Como tal, nestes casos, ou é utilizada uma tradução monótona (ou seja, em que as posições dos elementos que compõem a frase são mantidas da frase de partida para a frase de chegada) ou é permitida uma reordenação limitada que possibilite, por exemplo, proceder à inversão da ordem sujeito-verbo ou substantivo-adjetivo que ocorre frequentemente entre alguns pares de línguas (ibidem: 143). Normalmente, reordenações maiores ou ilimitadas resultam em piores traduções, refere Koehn (ibidem).

No modelo de reordenamento lexicalizado, é tida em consideração a orientação do alinhamento de cada palavra que compõe o par de phrases (ibidem: 143-144). Um ponto

43 de alinhamento no topo esquerdo significa que a palavra e anterior está alinhada com a palavra f anterior (orientação monótona). Um ponto de alinhamento no topo direito indica que a palavra e anterior está alinhada com a palavra f seguinte (orientação swap). Se não houver ponto de alinhamento no topo esquerdo ou direito há evidência de uma orientação descontínua.

Figura 11 – Tipos de orientação de phrases de acordo com o modelo de reordenação lexicalizada: (m) monótona, (s)

swap (troca) e (d) descontínua (Koehn, 2010: 143).

Neste tipo de reordenação, a probabilidade de distribuição de cada tipo de orientação de cada par de phrases é estimada a partir da contagem de cada par de phrases e de cada tipo de orientação desse par de phrases (ibidem).