python / python/cpython

tokenize.detect_encoding has issues with \r

Aperta
#93,608 3 commenti 0 reazioni 0 assegnatari Vedi su GitHub

Nessuno ha ancora preso questa issue.

stdlib type-bug
Lingua principale
Python
Stelle
77.2k
Fork
36k
Merge medio
1g 9h
PR unite (30g)
558

Descrizione

Tokenize does not correctly detect encodings when the carriage return character is involved. In this program, it does not detect the header, since it does not consider the \r to start a new line.

import tokenize
import runpy

code = """\r# coding: big5

print('錯誤的答案')
"""

with open('file.py', 'w', encoding='big5') as file:
    file.write(code)
with open('file.py', 'rb') as file:
    print(tokenize.detect_encoding(file.readline))
    # result: ('utf-8', [b'\r# coding: big5\r\n', b'\r\n'])

runpy.run_path('file.py')
# prints 錯誤的答案 as required

Guida per i contributori

Apri la guida per i contributori

Come iniziare

  1. Leggi tutta la issue e poi la guida ai contributi del progetto.
  2. Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
  3. Fai un fork del repository e lavora su un branch.
  4. Apri una pull request che faccia riferimento al numero della issue.

Direzione di ricerca

La issue nomina tokenize.detect_encoding e fornisce una riproduzione completa con ritorno a capo. Inizia eseguendo lo script fornito, quindi individua l’implementazione del rilevamento della codifica e i test esistenti; il lavoro è completato quando l’header di codifica viene rilevato come big5 quando \r lo precede, con copertura di regressione per questo input.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
python
Ambito
compilers
Tipo di issue
Bug
Difficoltà
3/5
Tempo stimato
1-2 giorni
Stato di attività
Ferma
Chiarezza
Abbastanza chiara
Idoneità per principianti
45/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.