aws / aws/sagemaker-python-sdk

Unable to increase context length in SM serverless customizations

Aperta
#5,665 0 commenti 0 reazioni 0 assegnatari Vedi su GitHub
Lingua principale
Python
Stelle
2.3k
Fork
1.3k
Merge medio
1g 22h
PR unite (30g)
35

Descrizione

**Describe the feature you'd like**
Currently customers cannot use GRPO for Qwen model customization for models using long context (more than 2048 tokens)

**How would this feature be used? Please describe.**
Should work similar to JumpStart training implementation:
estimator = JumpStartEstimator(
model_id="meta-textgeneration-llama-2-7b",
hyperparameters={
"max_input_length": "4096", # Update context length here
"max_total_tokens": "4096"
}
)

**Describe alternatives you've considered**
Using SM training jobs for GRPO training with recipes.

**Additional context**
Customer: Intuit (a high-priority issue blocking usage of SM serverless customization service).

Guida per i contributori

Apri la guida per i contributori

Direzione di ricerca

Inizia con il percorso di personalizzazione serverless e confronta la relativa configurazione con l’esempio JumpStartEstimator nell’issue. Traccia il modo in cui la personalizzazione GRPO gestisce i modelli Qwen e gli iperparametri max_input_length e max_total_tokens. Il lavoro è completato quando i clienti possono usare queste impostazioni per lunghezze del contesto superiori a 2048 token nella personalizzazione serverless di SM.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
aws, python
Ambito
cloud, machine-learning
Tipo di issue
Funzionalità
Difficoltà
4/5
Tempo stimato
3-5 giorni
Stato di attività
Tranquilla
Chiarezza
Abbastanza chiara
Idoneità per principianti
45/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.