aimclub / aimclub/OSA

research: Osa.Edu - Analyze BERT-like methods for claims deduplication task

Đang mở
#486 1 bình luận 0 reaction 1 người được giao Được @korhenon nhận Xem trên GitHub
Ngôn ngữ chính
Python
Star
143
Fork
23
Merge trung bình
5 ngày 9 giờ
Pull request đã merge (30 ngày)
2

Mô tả

Сейчас алгоритм проверки клеймов на соответствие коду выглядит так:
1. Из некоторых разделов пдф студенческой работы извлекаются клеймы
2. Они собираются в большой json для дедупликации (некоторые одинаковые клеймы могут быть в разных разделах)
3. Большой json подаётся в LLM с просьбой убрать дубликаты

Надо ли говорить, какое переполнение контекста возникает. Аж веса от LLM отклеиваются

Можно упростить по такому плану:
1. Берётся cosine similarity для всех возможных пар клеймов (n^2, если есть n клеймов)
2. Всё, что ниже мягкого threshold, опускается
3. Всё, что выше, считаем возможными кандидатами и отправляем на проверку с помощью LLM
4. Получаем список дубликатов, отсеиваем

Интерес представляет пункт 1, потому что векторизовать можно оч по-разному. Тебе нужно попробовать BERT-like модели, затюненные под задачи парафразирования:
1. paraphrase-multilingual-MiniLM-L12-v2
2. paraphrase-multilingual-mpnet-base-v2
3. intfloat/multilingual-e5-base
4. Мб ещё что-то найдёшь, скажи

Потестируй разные значения threshold (0.6-0.9, думаю, норм интервал) с разными моделями. Оцени количество кандидатов, которые проходят на этап 4. Посмотри (пока) глазами на качество их выделения

Hướng dẫn đóng góp

Chưa lập chỉ mục được hướng dẫn đóng góp cho kho mã nguồn này

Hướng nghiên cứu

Start by locating the current PDF claim-extraction flow and the large JSON-to-LLM deduplication step described in the issue. Compare the three named models across cosine-similarity thresholds from 0.6 to 0.9, recording how many candidates reach LLM review. Done means a documented comparison with manual quality observations and any additional model suggestions.

Do mô hình lập chỉ mục viết ra từ nội dung của issue.

Đánh giá

Công nghệ
python
Lĩnh vực
machine-learning
Loại issue
Tính năng
Độ khó
5/5
Thời gian dự kiến
Hơn một tuần
Mức độ hoạt động
Ít trao đổi
Độ rõ ràng
Khá rõ ràng
Mức phù hợp với người mới
35/100

Nhận issue mới trong hộp thư của bạn

Bản tóm tắt ngắn những issue GitHub phù hợp với người mới.