Accueil·Messages d’erreur

python · Python

Le message

UnicodeDecodeError: 'utf-8' codec can't decode byte 0xff in position 0: invalid start byte

Ce que cela veut dire

Vous avez lu un fichier ou une suite d'octets comme de l'UTF-8 et rencontré un octet que l'UTF-8 interdit ; le message donne la position et l'octet. Le plus souvent le fichier est en cp1252 ou dans un autre encodage hérité de Windows, ou ce n'est pas du texte du tout : une image, un zip, ou des données gzip non décompressées. La bonne réponse est de trouver l'encodage réel et de le passer via encoding= ; errors="replace" laisse la lecture s'achever mais change ces octets en points d'interrogation, et la donnée poursuit son chemin silencieusement abîmée.

Le correctif

Pas de commande en une ligne ici. L’explication dit où regarder.

Émis par
python
Python
18

Une trace Python coupe la réponse en deux : la dernière ligne dit ce qui a échoué, les cadres au-dessus disent où — ne lire que la dernière ligne donne le nom et fait perdre l'endroit ; et pour les erreurs de valeur absente comme NoneType et KeyError, la cause siège presque toujours dans un cadre au-dessus de celui qui a planté.

Lire un message d’erreur

  • Lisez à partir de la première ligne. Plus on descend, plus il s’agit des entrailles de l’outil ; la cause est généralement en haut.
  • S’il y a un fichier et un numéro de ligne, commencez là — pas la première image de la pile, mais la ligne la plus haute qui nomme un fichier de vous.
  • Cherchez le message tel quel, mais retirez d’abord vos chemins et vos noms de variables : c’est cela qui empêche la correspondance.
  • La même situation se formule autrement selon la version de l’outil. Si les résultats sonnent faux, ajoutez le numéro de version.
  • Avant de coller un correctif, vérifiez ce qu’il jette. Certains sont irréversibles.

Questions fréquentes

Q. Que veut dire « UnicodeDecodeError: 'utf-8' codec can't decode byte 0xff in position 0: invalid start byte » ?

Vous avez lu un fichier ou une suite d'octets comme de l'UTF-8 et rencontré un octet que l'UTF-8 interdit ; le message donne la position et l'octet. Le plus souvent le fichier est en cp1252 ou dans un autre encodage hérité de Windows, ou ce n'est pas du texte du tout : une image, un zip, ou des données gzip non décompressées. La bonne réponse est de trouver l'encodage réel et de le passer via encoding= ; errors="replace" laisse la lecture s'achever mais change ces octets en points d'interrogation, et la donnée poursuit son chemin silencieusement abîmée.

Q. Comment le corriger ?

Pas de commande en une ligne. L’explication ci-dessus dit où regarder.

Q. Quel outil émet cela ?

python. Cela relève de Python, et le message compte 13 mots.

Erreurs voisines