ProjectTech4DevAI / ProjectTech4DevAI/kaapi-backend

Inqui-Lab: Improving duplicate-detection

Abierto
#1,108 0 comentarios 0 reacciones 0 asignados Ver en GitHub

Nadie ha tomado este issue todavía.

Lenguaje dominante
Python
Estrellas
18
Forks
10
Merge medio
2 d 20 h
PR fusionados (30 d)
14

Descripción

Is your feature request related to a problem?
The pilot testing of the input app revealed inadequate duplicate detection, the need for a global knowledge base, and the correlation between duplicate detection and topic relevance. This lack affects processing effectiveness and user experience.

Describe the solution you'd like

  • Keep duplicate detection separate from L2 scoring, using weighted averages in post-processing.
  • Improve communication about duplicate detection accuracy (40–50%) and maintain a human-in-loop.
  • Utilize the model's trained knowledge for cost-effective duplicate assessment.
  • Integrate duplicate detection results as input for the next LLM stage.
  • Adjust prompts to guide LLM on handling duplicate results and novelty scoring.
  • Collaborate with the Input app team on prompt modifications while limiting Google search use.
Original issue

Context

Input app pilot testing (~2,000 dataset) surfaced missing duplicate detection, a desire for a global knowledge base, and duplicate detection linked to topic relevance. These are mostly prompt + pipeline changes.

Approach

Option 1:

  • Keep duplicate detection independent of L2 scoring; handle it in post-processing via a weighted average (a flagged idea may still be strong relative to the cohort — a decision input, not a score penalty).
  • Duplicate detection is ~40–50% accurate — communicate plainly, keep human-in-loop.
  • Cheaper alternative to global web search: lean on the model's trained knowledge via rubric wording ("if the idea is generally common, score lower on novelty").
    Option 2:
  • Feed the duplicate-detection result as an input into the next LLM stage (not done today).
  • Prompt then instructs the LLM to consider the duplicate result and assign appropriate novelty scores.
  • Need the Input app team's help on how they want the prompt changes shaped.
  • Keep some scope for Google search but treat cautiously (nondeterministic wide search).

Guía de contribución

Abrir la guía de contribución

Primeros pasos

  1. Lee el issue completo y luego la guía de contribución del proyecto.
  2. Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
  3. Haz un fork del repositorio y trabaja en una rama.
  4. Abre un pull request que haga referencia al número del issue.

Línea de trabajo

Empieza siguiendo el flujo de detección de duplicados y puntuación mediante LLM en el backend; después, revisa cómo se ensamblan los prompts y cómo Input app proporciona los resultados. Confirma con el equipo de Input app la separación, la transferencia y el comportamiento de revisión humana deseados. Se considera terminado cuando la señal de duplicado acordada llega a la siguiente etapa de LLM y su efecto en la puntuación de novedad está documentado y probado.

Escrito por el modelo de indexación a partir del texto del issue.

Evaluación

Stack tecnológico
python
Área
ai, backend
Tipo de issue
Nueva funcionalidad
Dificultad
5/5
Tiempo estimado
Más de una semana
Estado de actividad
Tranquilo
Claridad
Necesita aclaración
Aptitud para principiantes
35/100

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.