aimclub / aimclub/OSA

research: Osa.Edu - Analyze tf-idf and word2vec methods for claims deduplication task

Open
#485 0 comments 0 reactions 1 assignee Claimed by @Shtirmann View on GitHub
Dominant language
Python
Stars
143
Forks
23
Avg merge
5d 9h
Merged PRs (30d)
2

Description

Сейчас алгоритм проверки клеймов на соответствие коду выглядит так:
1. Из некоторых разделов пдф студенческой работы извлекаются клеймы
2. Они собираются в большой json для дедупликации (некоторые одинаковые клеймы могут быть в разных разделах)
3. Большой json подаётся в LLM с просьбой убрать дубликаты

Надо ли говорить, какое переполнение контекста возникает. Аж веса от LLM отклеиваются

Можно упростить по такому плану:
1. Берётся cosine similarity для всех возможных пар клеймов (n^2, если есть n клеймов)
2. Всё, что ниже мягкого threshold, опускается
3. Всё, что выше, считаем возможными кандидатами и отправляем на проверку с помощью LLM
4. Получаем список дубликатов, отсеиваем

Интерес представляет пункт 1, потому что векторизовать можно оч по-разному. Тебе нужно попробовать стандартные методы NLP: tf-idf, word2vec. Потестируй разные значения threshold (0.6-0.9, думаю, норм интервал), потыкай в разные параметры tf-idf и word2vec. Оцени количество кандидатов, которые проходят на этап 4. Посмотри (пока) глазами на качество их выделения

Contributor guide

No contributing guide indexed for this repository

Research direction

No files, tests, or entry points are named. Start by locating the existing PDF claim extraction and JSON/LLM deduplication flow, then compare tf-idf and word2vec cosine-similarity thresholds from 0.6 to 0.9; done means reporting candidate counts and manually assessed selection quality.

Written by the indexing model from the issue text.

Assessment

Tech stack
python
Domain
machine-learning
Issue type
Feature
Difficulty
5/5
Estimated time
Over a week
Activity status
Quiet
Clarity
Needs clarification
Newbie friendliness
30/100

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.