3.2 DESCRIÇÃO DOS MÉTODOS
3.2.2 Análise dos dados e Recuperação de Informação
3.2.2.1 Pré-processamento de texto e tokenização
Foi utilizada a funcionalidade de importação de textos da ferramenta Mallet para fazer um pré-processamento dos textos. As palavras de parada foram filtradas a partir de duas listas pré-criadas. A primeira é a lista que vem embutida na própria ferramenta (MCCALLUM, 2002), com palavras de parada em inglês. A segunda é uma lista de palavras em português (LOPES, 2012?) baixada da internet. Palavras pequenas foram filtradas de forma implícita através da expressão regular utilizada na tokenização.
A tokenização da ferramenta Mallet é baseada em expressão regular e possui uma expressão padrão, adaptada para o idioma inglês, que inclui letras e pontuações em palavras com três ou mais caracteres:
\p{L}[\p{L}\p{P}]+\p{L}
A expressão acima ignora acentos e cedilhas em alguns casos. Para esta pesquisa, foi utilizada outra expressão regular, adaptada para o idioma português:
(\p{L}\p{M}*){3,}
Essa expressão inclui letras, acentos e cedilhas em palavras com três ou mais caracteres. Ela também remove qualquer tipo de pontuação. Exemplos de palavras detectadas: “análise”, “tokenização”.
O resultado final do pré-processamento foram listas de palavras já todas em letras minúsculas, livres de pontuação, livres de palavras de parada e que poderiam ser convertidas diretamente para o formato Bag-of-Words.
3.2.2.2 Modelagem de Tópicos através de LDA
Com as Bag-of-Words montadas, foi possível fazer análises subsequentes em cima desses dados pré-processados. Para isto, foi utilizada a técnica de Modelagem de Tópicos, mais especificamente a Análise de Dirichlet Latente (LDA).
Foram feitas análises para geração de 10 e 300 tópicos. A técnica LDA requer que o número de tópicos seja parametrizado de forma arbitrária pelo pesquisador. O critério de arbitragem foi baseado na configuração padrão da própria ferramenta, que são de 10 tópicos
para uma análise superficial e também de 200 a 400 tópicos para uma análise de alta granularidade (MCCALLUM, 2018b). Outros parâmetros relevantes da ferramenta incluem a quantidade de iterações para o Gibbs Sampling, o hiperparâmetro Dirichlet alfa (α) para distribuições de documentos para tópicos e o hiperparâmetro Dirichlet beta (β) de distribuições de documentos para termos.
Para a geração de 10 tópicos foram utilizados os valores padrões da ferramenta Mallet a esses parâmetros. A quantidade de iterações padrão é de 1.000 iterações, o hiperparâmetro alfa padrão é 5/k, k sendo o número de tópicos. No caso, o hiperparâmetro alfa padrão é 0,5 para 10 tópicos. O hiperparâmetro gama padrão é de 0.01.
Para a geração de 300 tópicos, o número de iterações foi aumentado para 2.000. O motivo foi a verossimilhança do modelo de tópicos demorar mais para se estabilizar. Um gráfico com a progressão das verossimilhanças foi exibido nos resultados. O hiperparâmetro Dirichlet alfa padrão para 300 tópicos é 5/300 ou aproximadamente 0,01667.
O tamanho dos n-gramas também é parametrizado na ferramenta. Foi utilizada a configuração padrão da ferramenta, utilizando apenas unigramas.
Quadro 2 - Hiperparâmetros da Modelagem de Tópicos
Parâmetro Valor para 10 tópicos Valor para 300 tópicos
Quantidade de tópicos 10 (padrão) 300
Expressão regular (\p{L}\p{M}*){3,} (\p{L}\p{M}*){3,}
Número de iterações 1.000 (padrão) 2.000
Dirichlet alfa (α) 0,5 (padrão) 0,01667 (padrão)
Dirichlet beta (β) 0,01 (padrão) 0,01 (padrão)
N-gramas 1 (padrão) 1 (padrão)
Fonte: Elaboração própria
O resultado da análise LDA esperado eram várias distribuições Dirichlet-Multinomial, uma para cada tópico. Elas foram utilizadas para a próxima etapa de análise, usando TF-IDF.
3.2.2.3 Pós-processamento dos tópicos através de TF-IDF
A forma mais simples de visualizar a saída de uma Modelagem de Tópicos é mediante um ranqueamento de palavras, com as palavras de maior probabilidade em cada tópico aparecendo no topo da lista. Faz-se isso para cada tópico, e o resultado é uma lista por tópico das palavras de maior probabilidade. A probabilidade é estimada diretamente a partir das distribuições Dirichlet-Multinomial de saída.
Para esta pesquisa, as palavras foram pontuadas e reordenadas utilizando a métrica TF-IDF. A reordenação de palavras de tópicos utilizando alguma métrica alternativa à simples contagem de palavras foi inspirada nos trabalhos de Song (2009) e Pleplé (2013). O motivo principal foi viabilizar que buscas por palavras-chave pudessem ser feitas em cima dos tópicos resultantes da etapa anterior. No caso de haver apenas 10 tópicos, foi viável examinar todas as 10 listas de palavras de cada tópico. Porém, no caso de serem gerados 300 tópicos, uma etapa adicional de busca por palavras-chave se tornou atrativa para localizar os tópicos mais relevantes no meio de muitos outros. A atratividade foi ainda maior quando foi considerado que os resultados nas seções seguintes para 300 tópicos foram mais satisfatórios que para 10 tópicos. Uma motivação secundária foi a técnica TF-IDF funcionar como filtro secundário de palavras de parada, e palavras que não foram filtradas na etapa de pré- processamento de texto puderam ser filtradas no pós-processamento.
O cálculo da métrica TF-IDF foi subdividido em duas partes. A primeira é o cálculo da frequência de termos (TF). A segunda é o cálculo da frequência inversa de documentos (IDF). O cálculo TF foi desenvolvido em cima das distribuições Dirichlet-Multinomial resultantes da Modelagem de Tópicos. As contagens de palavras por tópico, que são parte das distribuições, foram usadas diretamente como valores para a métrica TF.
O cálculo IDF foi mais complexo e foi feito em cima das listas de palavras resultantes do pré-processamento, antes de qualquer cálculo relacionado com a Modelagem de Tópicos. Fazer este cálculo em cima dos resultados da Modelagem de Tópicos era uma alternativa, considerando cada tópico como se fosse um grande documento, como o cálculo TF, mas não foi assim executado em razão de a métrica IDF ser sensível a ruído, e a técnica Gibbs
Sampling usada na Modelagem de Tópicos introduz ruído nos resultados porque se baseia no
método Monte Carlo. Por conseguinte, fez-se o cálculo independente dos tópicos e diretamente em cima de palavras e documentos.
O cálculo TF-IDF resultante foi alcançado simplesmente multiplicando o resultado dos cálculos TF e IDF entre si, para cada palavra, para cada tópico.
3.2.2.4 Visualização dos tópicos gerados
Com os tópicos calculados e as palavras de cada tópico pontuadas com a métrica TF- IDF, a próxima etapa da análise dos dados foi visualizar a saída combinada das técnicas de Modelagem de Tópicos e TF-IDF. Para tanto foram exibidos, nas seções de resultados e também no apêndice, quadros das palavras com maior TF-IDF de cada tópico. Também foram exibidas Tag Clouds com as palavras de maior TF-IDF de cada tópico. Além das palavras mais relevantes, foram exibidas quadros com os documentos mais relevantes de cada tópico. Por último, a métrica TF-IDF foi usada para ranquear os tópicos a partir de uma palavra- chave de escolha. O resultado final, a partir de uma palavra-chave de escolha, pôde ser visualizado no tópico mais relevante em relação a esta palavra e também os documentos mais relevantes em relação a este tópico.
3.2.2.4.1 Quadros de palavras mais relevantes
A ferramenta Mallet produz várias Bag-of-Words como resultado dos cálculos, uma para cada tópico. Existem diversas formas de visualizar estas Bag-of-Words. Para esta pesquisa foram utilizados quadros e Tag Clouds, com os termos presentes nas bag-of-words ordenados pela métrica TF-IDF.
3.2.2.4.2 Tag Cloud
Os termos com maior TF-IDF também foram exibidos na forma de Tag Clouds, que comportam uma quantidade bem superior a 10 termos de forma compacta e visualmente atrativa. Nas Tag Clouds, o tamanho das palavras representa a posição no ranking de TF-IDF de cada tópico. O elemento com maior contagem aparece maior com fonte tamanho 40, o com segunda maior contagem aparece linearmente menor, e assim por diante, até o último termo exibido aparecer com fonte tamanho 10. As cores e orientação dos elementos seguiram critérios apenas estéticos, visando o aumento da legibilidade.
A quantidade de elementos por tag cloud foi definida pela quantidade máxima de elementos que cabem nesta mesma Tag Cloud sem acarretar em sobreposição de termos. A quantidade foi calculada individualmente por tópico.
3.2.2.4.3 Tabelas de documentos mais relevantes
Os 10 documentos mais relevantes para cada tópico estão listados após as Tags Clouds desses tópicos. A identificação de cada documento foi exibida em quatro colunas, com as colunas de empresa, categoria e data referência vindas dos dados da base de dados da CVM, e a quarta coluna (proportion) contendo a proporção de termos pertencendo ao tópico, calculado a partir do resultado do cálculo LDA.
3.2.2.4.4 Tabelas de tópicos mais relevantes
Uma prova de conceito de recuperação da informação foi elaborada em cima dos tópicos resultantes da análise LDA. Uma consulta foi feita baseada em algumas palavras- chaves. Uma delas foi o termo “receita”. Esta palavra-chave foi escolhida arbitrariamente, devido à “receita” ser um dos indicadores mais comuns na administração de empresas. Outro conjunto de termos usado em uma segunda consulta foi “receita da companhia”. Os termos “da” e “companhia” foram adicionados à consulta original para testar a eficácia da técnica TF-IDF em filtrar termos irrelevantes em uma consulta. Uma terceira consulta foi aplicada com o termo “ética” para exibir a capacidade das técnicas empregadas em recuperar informações de natureza qualitativa. Em teoria, as palavras-chave usadas nas consulta poderiam ser qualquer palavra usada com frequência em documentos de administração.
Os resultados das consultas foram exibidos na forma de quadros com rankings de tópicos ordenados por relevância. A primeira coluna (Consulta) contém o termo da consulta; a segunda coluna (Tópico) contém o indicador do tópico, de 0 a 9/299; a terceira coluna (Contagem) contém a contagem bruta vinda da bag-of-words; e a quarta coluna (P(t|w)) é a probabilidade de um tópico, dada uma palavra de consulta. A quarta coluna foi calculada dividindo-se a contagem de uma palavra em um tópico, pela soma de todas as contagens em todos os tópicos para esta mesma palavra.
4 RESULTADOS
Nesta seção foram descritos os resultados obtidos na aplicação das técnicas descritas nas seções anteriores. Primeiro, foram exibidas estatísticas relacionadas à coleta de dados. A seguir foi descrito o acompanhamento do cálculo da Modelagem de Tópicos, na forma de gráficos de verossimilhança. Depois, com a Modelagem de Tópicos completa, foi exibido um quadro com os 10 tópicos gerados de forma resumida e também referências para quadros e tag
clouds no apêndice para os 10 tópicos de forma mais detalhada. Nos quadros detalhados, há a
pontuação TF-IDF para as palavras mais relevantes de cada tópico. Logo depois, foram exibidos resultados de buscas por palavra-chave em cima dos tópicos usando TF-IDF. A seguir, o mesmo foi exibido para a geração de 300 tópicos, com uma referência para um quadro resumido dos tópicos no apêndice, seguida de quadros detalhados e tag clouds também no apêndice e buscas por palavras-chave em cima dos 300 tópicos. Por último, foi descrito um resumo de resultados de tentativas de utilização de outras técnicas com resultado insatisfatório.