research: Osa.Edu - Analyze BERT-like methods for claims deduplication task
- Ngôn ngữ chính
- Python
- Star
- 143
- Fork
- 23
- Merge trung bình
- 5 ngày 9 giờ
- Pull request đã merge (30 ngày)
- 2
Mô tả
Сейчас алгоритм проверки клеймов на соответствие коду выглядит так:
1. Из некоторых разделов пдф студенческой работы извлекаются клеймы
2. Они собираются в большой json для дедупликации (некоторые одинаковые клеймы могут быть в разных разделах)
3. Большой json подаётся в LLM с просьбой убрать дубликаты
Надо ли говорить, какое переполнение контекста возникает. Аж веса от LLM отклеиваются
Можно упростить по такому плану:
1. Берётся cosine similarity для всех возможных пар клеймов (n^2, если есть n клеймов)
2. Всё, что ниже мягкого threshold, опускается
3. Всё, что выше, считаем возможными кандидатами и отправляем на проверку с помощью LLM
4. Получаем список дубликатов, отсеиваем
Интерес представляет пункт 1, потому что векторизовать можно оч по-разному. Тебе нужно попробовать BERT-like модели, затюненные под задачи парафразирования:
1. paraphrase-multilingual-MiniLM-L12-v2
2. paraphrase-multilingual-mpnet-base-v2
3. intfloat/multilingual-e5-base
4. Мб ещё что-то найдёшь, скажи
Потестируй разные значения threshold (0.6-0.9, думаю, норм интервал) с разными моделями. Оцени количество кандидатов, которые проходят на этап 4. Посмотри (пока) глазами на качество их выделения
Hướng dẫn đóng góp
Chưa lập chỉ mục được hướng dẫn đóng góp cho kho mã nguồn này
Hướng nghiên cứu
Start by locating the current PDF claim-extraction flow and the large JSON-to-LLM deduplication step described in the issue. Compare the three named models across cosine-similarity thresholds from 0.6 to 0.9, recording how many candidates reach LLM review. Done means a documented comparison with manual quality observations and any additional model suggestions.
Do mô hình lập chỉ mục viết ra từ nội dung của issue.
Đánh giá
- Công nghệ
- python
- Lĩnh vực
- machine-learning
- Loại issue
- Tính năng
- Độ khó
- 5/5
- Thời gian dự kiến
- Hơn một tuần
- Mức độ hoạt động
- Ít trao đổi
- Độ rõ ràng
- Khá rõ ràng
- Mức phù hợp với người mới
- 35/100