UD_Latin-CicPhil: primeiros passos para a criação de um corpus sintaticamente anotado das obras filosóficas de Cícero (106–43 a.C)
Coordenador: LUCAS CONSOLIN DEZOTTI
E-mail: lucas.dezotti@academico.ufpb.br
| Edital: | 2026/2027 – EDITAL 01/2026/PROPESQ – PIBIC/PIBIT/UFPB/CNPq – SELEÇÃO DE PROJETOS DE INICIAÇÃO CIENTÍFICA | ||
|---|---|---|---|
| Cota: | 2026-2027 PIBIC-CNPQ-UFPB (01/09/2026 a 31/08/2027) | ||
| Área de Conhecimento: | Línguas Clássicas | ||
| Grupo de Pesquisa: | — | ||
| Linha de Pesquisa: | Linguística Aplicada | ||
| Código SIGAA: | PIB21886-2026 | ||
| Página SIGAA: | https://sigaa.ufpb.br/sigaa/public/docente/pesquisa.jsf?siape=1989775 | ||
Este projeto foi elaborado com o objetivo de viabilizar a produção de um treebank — termo que designa um corpus de textos enriquecido com anotação morfossintática — das obras filosóficas escritas em latim por Marco Túlio Cícero (106–43 a.C). O projeto se situa principalmente na área de Letras, sub-área Línguas Clássicas. Não obstante, tem forte natureza interdisciplinar, envolvendo conceitos e métodos pertinentes às áreas da Linguística (sub-área Teoria e Análise Linguística) e da Ciência da Computação (sub-área Metodologia e Técnicas da Computação, especialidade Processamento de Linguagem Natural). O contexto é a coleção multilíngue de treebanks organizada pelo projeto Universal Dependencies (Nivre et al., 2016). Atualmente há seis corpora relativos ao latim, recobrindo diversas variedades linguísticas de uso dessa língua em um arco temporal de quinze séculos (de I a.C. a XIV d.C.). Todavia, pode-se dizer que a variedade do latim clássico, relativa aos textos escritos entre II a.C. e II d.C., é sub-representada, correspondendo a menos de 15% do total, malgrado sua importância para a área interdisciplinar dos Estudos Clássicos, que abrange pesquisas em Linguística, Literatura, Filosofia, História e Arqueologia das civilizações da Antiguidade. Essa sub-representação gera dois problemas para a pesquisa nesse campo. De um lado, as pesquisas realizadas a partir das evidências coletadas em treebanks — como, por exemplo, sobre teoria morfossintática (Haug, 2015), lexicografia (McGillivray; Vatri, 2015), similaridade textual (Bamman; Crane, 2008), estilo e autoria (Cecchini; Pedonese, 2022) — encontram limitações no que se refere ao latim clássico, dada a pouca quantidade de dados disponíveis. De outro, treebanks são utilizados como parâmetro para o desenvolvimento de modelos de linguagem para anotação automática de textos, os chamados parsers (Burns, 2023), cuja eficiência depende, entre outros fatores, da adequação dos dados de treinamento ao objeto de análise. Em outras palavras, modelos treinados com textos de latim medieval tendem a ser menos eficazes quando aplicados a textos de latim clássico. Para suprir essa lacuna, este projeto busca responder principalmente a duas perguntas de pesquisa. Primeiro: como produzir coletivamente um novo treebank de textos latinos que possa agregar-se ao conjunto existente de corpora sintaticamente anotados e seja relevante para a pesquisa em Estudos Clássicos? Segundo: quanto um modelo de linguagem treinado exclusivamente com textos de um domínio específico é mais eficiente do que um modelo geral quando aplicado a textos desse mesmo domínio? Dado o interesse de diversas áreas pelo gênero Filosofia, cujos textos congregam as reflexões e o conhecimento sobre o mundo produzido na Antiguidade, e considerando que o principal autor desse gênero na Roma Antiga é Marco Túlio Cícero (106–43 a.C), este projeto estabelece como objetivo geral viabilizar a produção de um treebank com algumas das obras filosóficas escritas em latim por este autor. Tal produção se dará de forma coletiva, como resultado das contribuições individuais dos participantes da pesquisa, e se baseia em recomendações metodológicas para anotação de corpus (Freitas, 2024) e experiências anteriores (Cecchini et al., 2020), incluindo seu uso em contextos pedagógicos (Mambrini, 2016).