aimclub / aimclub/OSA

research: Osa.Edu - Analyze tf-idf and word2vec methods for claims deduplication task

Open
#485 0 comments 0 reactions 1 assignee Claimed by @Shtirmann View on GitHub
Dominant language
Python
Stars
143
Forks
23
Avg merge
5d 9h
Merged PRs (30d)
2

Description

Сейчас алгоритм проверки клеймов на соответствие коду выглядит так:
1. Из некоторых разделов пдф студенческой работы извлекаются клеймы
2. Они собираются в большой json для дедупликации (некоторые одинаковые клеймы могут быть в разных разделах)
3. Большой json подаётся в LLM с просьбой убрать дубликаты

Надо ли говорить, какое переполнение контекста возникает. Аж веса от LLM отклеиваются

Можно упростить по такому плану:
1. Берётся cosine similarity для всех возможных пар клеймов (n^2, если есть n клеймов)
2. Всё, что ниже мягкого threshold, опускается
3. Всё, что выше, считаем возможными кандидатами и отправляем на проверку с помощью LLM
4. Получаем список дубликатов, отсеиваем

Интерес представляет пункт 1, потому что векторизовать можно оч по-разному. Тебе нужно попробовать стандартные методы NLP: tf-idf, word2vec. Потестируй разные значения threshold (0.6-0.9, думаю, норм интервал), потыкай в разные параметры tf-idf и word2vec. Оцени количество кандидатов, которые проходят на этап 4. Посмотри (пока) глазами на качество их выделения

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.