Voltar para projetos

Categoria

Clusterização de embeddings

Proximidade semântica de frases e adjetivos no espaço latente, para estudos com LLMs.

PythonBeatifulSoupWeb ScrapingScikit-learnLLMsClusters
Ver no GitHub

Sobre o projeto

O projeto se trata de uma clusterização por similaridade semântica. Durante meu TCC, propus uma ideia para um problema a qual tinha para realizar os experimentos. Unir prompt, psicologia e similaridade. Logo, pensei, porquê não fazer os embeddings para menssurar a proximidade das frases e adjetivos?

Essas frases e adjetivos são relacionados ao modelo de divisão de personalidade proposto por Goldberg em seu estudo. Já as frases são frases são do conjunto de estudo realizado pelo IPIP. Então realizei os embeddgins de todos esses textos, e medi a similaridade das frases para com os adjetivos.

Galeria — Gráficos e Resultados

Descrição da galeria

Gráfico 1
Figura 1 — Legenda
Gráfico 2
Figura 2 — Legenda
Gráfico 3
Figura 3 — Legenda

Dica: substitua os arquivos em img/placeholder-*.svg pelos seus PNG/JPG (ex.: img/embed-umap.png) e atualize o src acima.

Metodologia

Detalhes de metodologia

Tecnologias

Tecnologias