facebookresearch / facebookresearch/ProgramBench
Request gold compile.sh scripts
- Vorherrschende Sprache
- Python
- Sterne
- 928
- Forks
- 66
- PR-Merge-Kennzahlen
- Keine gemergten PRs in 30 T.
Beschreibung
Hi there.
Really like this benchmark. I’m building a Modal-based pipeline to evaluate ProgramBench with higher parallelism, and I’d like to validate my implementation end-to-end without running a full agent each time.
For that purpose, I’m looking for a way to mock the agent generation phase with known-good submissions. The repo part is simple as the commit hash is known. As for the compile script part, it is a little bit tricky. Would it be possible to release the compile.sh scripts used to build the gold/reference executables, or any equivalent reference build scripts?
I understand if these cannot be shared due to benchmark integrity concerns. In that case, is there a recommended way to create a small set of known-good mock submissions for validating the evaluation pipeline?
Beitragsleitfaden
Rechercherichtung
Finde die goldenen/Referenz-compile.sh-Skripte und prüfe, wie die Evaluierungspipeline Repository-Commits und erstellte ausführbare Dateien verarbeitet. Bestimme, ob die Skripte veröffentlicht werden können, ohne die Integrität des Benchmarks zu beeinträchtigen; abgeschlossen ist die Aufgabe entweder durch die Bereitstellung der Referenz-Build-Skripte oder durch die Dokumentation eines unterstützten Wegs zum Erstellen bekanntermaßen funktionierender Mock-Submissions.
Vom Indexierungsmodell aus dem Issue-Text verfasst.
Bewertung
- Tech-Stack
- python, shell
- Bereich
- testing, tooling
- Issue-Typ
- Feature
- Schwierigkeit
- 4/5
- Geschätzter Aufwand
- 3-5 Tage
- Aktivitätsstatus
- Ruhig
- Klarheit
- Größtenteils klar
- Anfängerfreundlichkeit
- 45/100