research: Osa.Edu - Analyze tf-idf and word2vec methods for claims deduplication task
- Dominant language
- Python
- Stars
- 143
- Forks
- 23
- Avg merge
- 5d 9h
- Merged PRs (30d)
- 2
Description
Сейчас алгоритм проверки клеймов на соответствие коду выглядит так:
1. Из некоторых разделов пдф студенческой работы извлекаются клеймы
2. Они собираются в большой json для дедупликации (некоторые одинаковые клеймы могут быть в разных разделах)
3. Большой json подаётся в LLM с просьбой убрать дубликаты
Надо ли говорить, какое переполнение контекста возникает. Аж веса от LLM отклеиваются
Можно упростить по такому плану:
1. Берётся cosine similarity для всех возможных пар клеймов (n^2, если есть n клеймов)
2. Всё, что ниже мягкого threshold, опускается
3. Всё, что выше, считаем возможными кандидатами и отправляем на проверку с помощью LLM
4. Получаем список дубликатов, отсеиваем
Интерес представляет пункт 1, потому что векторизовать можно оч по-разному. Тебе нужно попробовать стандартные методы NLP: tf-idf, word2vec. Потестируй разные значения threshold (0.6-0.9, думаю, норм интервал), потыкай в разные параметры tf-idf и word2vec. Оцени количество кандидатов, которые проходят на этап 4. Посмотри (пока) глазами на качество их выделения
Contributor guide
No contributing guide indexed for this repository
Research direction
No files, tests, or entry points are named. Start by locating the existing PDF claim extraction and JSON/LLM deduplication flow, then compare tf-idf and word2vec cosine-similarity thresholds from 0.6 to 0.9; done means reporting candidate counts and manually assessed selection quality.
Written by the indexing model from the issue text.
Assessment
- Tech stack
- python
- Domain
- machine-learning
- Issue type
- Feature
- Difficulty
- 5/5
- Estimated time
- Over a week
- Activity status
- Quiet
- Clarity
- Needs clarification
- Newbie friendliness
- 30/100