research: Osa.Edu - Analyze tf-idf and word2vec methods for claims deduplication task
- Dominant language
- Python
- Stars
- 143
- Forks
- 23
- Avg merge
- 5d 9h
- Merged PRs (30d)
- 2
Description
Сейчас алгоритм проверки клеймов на соответствие коду выглядит так:
1. Из некоторых разделов пдф студенческой работы извлекаются клеймы
2. Они собираются в большой json для дедупликации (некоторые одинаковые клеймы могут быть в разных разделах)
3. Большой json подаётся в LLM с просьбой убрать дубликаты
Надо ли говорить, какое переполнение контекста возникает. Аж веса от LLM отклеиваются
Можно упростить по такому плану:
1. Берётся cosine similarity для всех возможных пар клеймов (n^2, если есть n клеймов)
2. Всё, что ниже мягкого threshold, опускается
3. Всё, что выше, считаем возможными кандидатами и отправляем на проверку с помощью LLM
4. Получаем список дубликатов, отсеиваем
Интерес представляет пункт 1, потому что векторизовать можно оч по-разному. Тебе нужно попробовать стандартные методы NLP: tf-idf, word2vec. Потестируй разные значения threshold (0.6-0.9, думаю, норм интервал), потыкай в разные параметры tf-idf и word2vec. Оцени количество кандидатов, которые проходят на этап 4. Посмотри (пока) глазами на качество их выделения
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.