Este trabalho, portanto, tem como objetivo analisar a ocorrência de palavras em inglês em postagens na rede social Twitter no período de 2019 a 2022. A partir disso foi possível responder às seguintes questões: “Quais são as médias de uso das palavras em inglês mais usadas no Twitter em português brasileiro?”; "Existe diferença na prevalência do uso de palavras em inglês entre domínios/setores sociais e econômicos do Twitter no Brasil?";. Existe diferença na prevalência entre os usuários quanto ao uso de palavras em inglês no Twitter em português do Brasil?”; e “Existe variação temporal no uso de palavras em inglês no Twitter no Brasil.
Mais especificamente, há um aumento ou diminuição no uso de palavras em inglês com a pandemia do COVID-19 como ponto de referência?
INTRODUÇÃO
Devido ao caráter anglocêntrico das redes sociais e ao isolamento social causado pela pandemia, pode haver um aumento do uso de palavras em inglês na comunicação do português brasileiro nas redes sociais. Qual é o uso médio das palavras em inglês mais usadas no Twitter em português do Brasil. Há uma diferença na incidência do uso de palavras em inglês entre os domínios/setores sociais e econômicos do Twitter no Brasil.
Há diferença na prevalência entre os usuários quanto ao uso de palavras em inglês no Twitter no português brasileiro.
FUNDAMENTAÇÃO TEÓRICA
Linguística de corpus (LC)
Um objetivo central de um corpus é ser "representativo da língua, uma língua ou uma variedade dela". (BERBER SARDINHA, 2004, p. 22). E embora não existam critérios muito objetivos para determinar a representatividade de um corpus, ainda é preciso ter a maior quantidade possível de dados linguísticos para se obter uma seleção abundante de características lingüísticas, especialmente de baixa frequência. Por exemplo, pesquisadores que desejam analisar a variação lexical encontrada nos sambas-enredo de escolas dos estados de São Paulo e Rio de Janeiro precisam de um corpus que contenha em sua totalidade, e quando isso não for possível, dados linguísticos predominantemente escritos. em português ou falado por brasileiros nativos dessas regiões dentro do contexto proposto, ou seja, sambas-enredo (ver GONÇALVES, 2019).
No caso desta pesquisa, o corpus de estudo teve como objetivo representar a língua portuguesa utilizada no Twitter por determinados setores (domínios). Segundo Kennedy (2014, tradução do autor), “seria errado afirmar que a linguística de corpus é uma teoria da linguagem paralela a outras teorias como a gramática transformacional, ou mesmo que é um ramo novo ou separado da linguística”. por um lado, a lingüística de corpus seria a "metodologia" lingüística como ela inclui. Berber Sardinha (2014, p. 37) considera que a linguística de corpus seria “uma forma de chegar à linguagem” ou, como preferem alguns linguistas, uma “abordagem baseada em corpus”.
Considerando o corpus criado para a pesquisa do presente trabalho, podemos concluir que ele constitui a base de uma abordagem lingüística empírica para descobrir a extensão do uso de anglicismos na língua portuguesa utilizada no Twitter no Brasil. A presente pesquisa não possui objetivos teóricos voltados para uma discussão teórica sobre as questões da presença de mulheres estrangeiras na língua portuguesa. Como a Linguística de Corpus está indissociavelmente ligada ao progresso tecnológico, sua história mudou consideravelmente com o aumento do poder de processamento e disponibilidade de equipamentos.
Alguns dos marcos tecnológicos da Linguística de Corpus são: SEU (Survey of English Usage), um corpus não informatizado de textos escritos e falados com cerca de 1 milhão de palavras em inglês britânico, conhecido por sua composição organizada, servindo de referência para o desenvolvimento de marcadores no final dos anos 1950; O “primeiro codificador morfossintático de computador” de Taggit em 1970; "um dos programas pioneiros para microcomputadores" em 1987 que permitia listas de palavras e concordâncias; e a suíte WordSmith Tools, que foi a primeira a trazer a Linguística de Corpus para o ambiente Windows, já no final do século XX (cf. BERBER SARDINHA, 2004). Corpora importantes na história da linguística de corpus incluem o Brown University Standard Corpus of Present-day American English, um corpus pioneiro de 1 milhão de palavras escritas em inglês americano desde 1964; British National Corpus, o primeiro a conter 100 milhões de palavras do inglês britânico, de 1995; e Bank of English, uma coleção de palavras do inglês britânico, de 1987 (cf. BERBER SARDINHA, 2004).
Estrangeirismos
No Brasil, Biderman (1978) cita alguns corpora da língua portuguesa como pioneiros: o Frequency Dictionary of Portuguese Words, um dos primeiros corpora eletrônicos do português, e os do português brasileiro compilados por Jean Roche (década de 1960) e J. a percepção de alguns setores da sociedade que eram muito usados expressões estrangeiras, surgiram movimentos que visavam limitar o uso de palavras e expressões estrangeiras como medida de proteção e preservação da identidade cultural nacional, como projetos de lei de Aldo Rebelo (BRASIL, 1999) ) e Raul Carrion (BRASIL, 2009). Tais iniciativas afirmam que há uma "invasão arbitrária e desnecessária de palavras estrangeiras" (REBELO, 1999, p.107), de palavras usadas em inglês, mesmo quando há palavras equivalentes em português, como 'beber'.
Além disso, segundo Bosi (2017, p.11), o uso de palavras estrangeiras não só é inevitável, como “não afeta a língua portuguesa”, pois haveria “um aumento do vocabulário”, ou seja, o uso de palavras emprestadas enriqueceria a língua portuguesa.
METODOLOGIA
- Design e coleta do corpus de pesquisa
- Critérios para seleção dos usuários
- Scraping
- Limpeza de corpus
- Corpus de Referência
- Indexação do corpus
- Remoção de palavras indesejadas
- Análise estatística
A ingestão de usuários "influentes" foi baseada na lista de usuários brasileiros com mais seguidores no Twitter em 2022. iii. Após a consolidação da lista de usuários de onde seriam coletados os tweets, foi necessário realizar as mensagens, ou seja, a raspagem dos dados da Internet. O próximo passo é limpar o corpus, ou seja, converter os arquivos JSON brutos em arquivos TXT limpos.
Para detectar a presença de palavras em inglês em postagens em português, foi necessário utilizar dois corpora de referência: um corpus em inglês e outro em português. Para tanto, foram utilizados os dois corpora mencionados no artigo anterior: (I) o corpus iWeb, de palavras em inglês, como base para encontrar as palavras que formarão o corpus; (II) o corpus CLIMA-CLIC, de palavras em português, que servirá de filtro para retirar palavras que não irão compor o corpus, ou seja, palavras em português. A partir disso, o script criou outro arquivo TXT com a lista de palavras em inglês presentes em todas as postagens de todos os usuários selecionados, com base no Corpus I e II.
Esta lista representa o vocabulário de inglês contemporâneo em uso em todo o mundo, por meio da escrita especializada. Essa lista representa a língua portuguesa sem a presença de palavras estrangeiras recentes como site, backup e download, por meio de um script especializado. Consultar manualmente a lista de candidatos, extraindo formas de vocabulário semelhantes, como dental, legalize, maestro, minimize, informal e cramp; falsos apegos como machucar, estalar e clicar; e formas inglesas que, por terem sotaque fraco, passaram a ter correspondência em português, como 'tripe', 'bone'.
Identifique a presença de cada palavra na lista final de candidatos em cada post, usando um script especializado. Quando a lista de palavras em inglês estava pronta, começou a remoção de palavras indesejadas.
RESULTADOS
- Primeira pergunta de pesquisa: variação entre vocábulos
- Vocábulos mais utilizados no domínio empresarial
- Vocábulos mais utilizados por usuários “influenciadores”
- Vocábulos mais utilizados no domínio governamental
- Vocábulos mais utilizados por usuários “aleatórios”
- Segunda pergunta de pesquisa: variação entre domínios
- Terceira pergunta de pesquisa: variação entre usuários
- Quarta pergunta de pesquisa: Variação Temporal
Por fim, o domínio das pessoas comuns utilizou o maior vocabulário, com 3360 palavras em inglês. Como mostra a Tabela 6 abaixo, a predominância é novamente de palavras usadas nas redes sociais, mas também no universo das celebridades, como tweet, favorito, app e off. No entanto, o fato de o grupo de pessoas comuns ficar em segundo lugar é inesperado, mesmo com metade das palavras em inglês em média entre o grupo de empresas.
Esses resultados mostram que o grupo com maior número de tweets com palavras em inglês é o de pessoas comuns (37%), seguido por empresas, governo e influenciadores. Em termos de frequência de uso de palavras em inglês, há um post com uma palavra em inglês para cada 2,7 posts no grupo de pessoas comuns, seguido de 1 em 6,8 para empresas, 1 em 17,2 para governo e 1 em 7,68 para influenciadores. Comparando as Tabelas 7 e 8, vemos que embora as empresas utilizem um número maior de palavras em inglês, elas fazem menos postagens com a palavra em inglês do que as pessoas comuns.
Usuários "aleatórios", por outro lado, usam palavras em inglês com mais frequência, apesar de usarem menos palavras. Em relação à segunda questão de pesquisa, a Tabela 9 lista os vinte usuários com maior média de uso de palavras em inglês no corpus. Os resultados mostram que há apenas dois representantes do grupo de pessoas comuns na lista dos vinte usuários que mais usam palavras em inglês, conforme destacado na tabela anterior.
No geral, os resultados mostram que houve um aumento no uso de palavras em inglês durante a pandemia de COVID-19. Isso confirma o resultado anterior, mostrando que os trimestres com maior média de uso de palavras em inglês ocorreram durante a pandemia de COVID-19.
CONSIDERAÇÕES FINAIS
Também seria interessante verificar o uso das palavras usadas para ver se o uso dessas palavras no português brasileiro e no inglês são semelhantes ou diferentes. Este trabalho mostra que é possível (e desejável) utilizar a Linguística de Corpus para explorar questões que norteiam o debate público sobre a vida nacional, de forma que os setores envolvidos tenham dados concretos para se basear. Estrangeiros: "up" em português ou "déficit" de identidade linguística. lt;http://repositorio.fucamp.com.br/bitstream/FUCAMP/213/1/Estrangeirismoslinguaportu guesa.pdf>.
Dispõe sobre a obrigatoriedade de tradução de expressões ou palavras estrangeiras para o português, quando houver palavra ou expressão equivalente em nosso idioma, no âmbito do Estado do Rio Grande do Sul e dá outras providências. Assegura a promoção, proteção, defesa e uso da língua portuguesa e dá outras providências. lt;http://www.camara.gov.br/proposicoesWeb/fichadetramitacao?idProposicao=17069>. Linguística de corpus e estilo: análises multidimensionais e canônicas na ficção de Machado de Assis.