aimclub / aimclub/OSA

research: Osa.Edu - Analyze BERT-like methods for claims deduplication task

Ouverte
#486 1 commentaire 0 réactions 1 personne assignée Réclamée par @korhenon Voir sur GitHub
Langage dominant
Python
Étoiles
143
Forks
23
Merge moyen
5 j 9 h
PR mergées (30 j)
2

Description

Сейчас алгоритм проверки клеймов на соответствие коду выглядит так:
1. Из некоторых разделов пдф студенческой работы извлекаются клеймы
2. Они собираются в большой json для дедупликации (некоторые одинаковые клеймы могут быть в разных разделах)
3. Большой json подаётся в LLM с просьбой убрать дубликаты

Надо ли говорить, какое переполнение контекста возникает. Аж веса от LLM отклеиваются

Можно упростить по такому плану:
1. Берётся cosine similarity для всех возможных пар клеймов (n^2, если есть n клеймов)
2. Всё, что ниже мягкого threshold, опускается
3. Всё, что выше, считаем возможными кандидатами и отправляем на проверку с помощью LLM
4. Получаем список дубликатов, отсеиваем

Интерес представляет пункт 1, потому что векторизовать можно оч по-разному. Тебе нужно попробовать BERT-like модели, затюненные под задачи парафразирования:
1. paraphrase-multilingual-MiniLM-L12-v2
2. paraphrase-multilingual-mpnet-base-v2
3. intfloat/multilingual-e5-base
4. Мб ещё что-то найдёшь, скажи

Потестируй разные значения threshold (0.6-0.9, думаю, норм интервал) с разными моделями. Оцени количество кандидатов, которые проходят на этап 4. Посмотри (пока) глазами на качество их выделения

Guide de contribution

Aucun guide de contribution indexé pour ce dépôt

Évaluation

Cette issue n'a pas encore été évaluée.

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.