research: Osa.Edu - Analyze BERT-like methods for claims deduplication task
- Langage dominant
- Python
- Étoiles
- 143
- Forks
- 23
- Merge moyen
- 5 j 9 h
- PR mergées (30 j)
- 2
Description
Сейчас алгоритм проверки клеймов на соответствие коду выглядит так:
1. Из некоторых разделов пдф студенческой работы извлекаются клеймы
2. Они собираются в большой json для дедупликации (некоторые одинаковые клеймы могут быть в разных разделах)
3. Большой json подаётся в LLM с просьбой убрать дубликаты
Надо ли говорить, какое переполнение контекста возникает. Аж веса от LLM отклеиваются
Можно упростить по такому плану:
1. Берётся cosine similarity для всех возможных пар клеймов (n^2, если есть n клеймов)
2. Всё, что ниже мягкого threshold, опускается
3. Всё, что выше, считаем возможными кандидатами и отправляем на проверку с помощью LLM
4. Получаем список дубликатов, отсеиваем
Интерес представляет пункт 1, потому что векторизовать можно оч по-разному. Тебе нужно попробовать BERT-like модели, затюненные под задачи парафразирования:
1. paraphrase-multilingual-MiniLM-L12-v2
2. paraphrase-multilingual-mpnet-base-v2
3. intfloat/multilingual-e5-base
4. Мб ещё что-то найдёшь, скажи
Потестируй разные значения threshold (0.6-0.9, думаю, норм интервал) с разными моделями. Оцени количество кандидатов, которые проходят на этап 4. Посмотри (пока) глазами на качество их выделения
Guide de contribution
Aucun guide de contribution indexé pour ce dépôt
Évaluation
Cette issue n'a pas encore été évaluée.