python · Python

メッセージ

UnicodeDecodeError: 'utf-8' codec can't decode byte 0xff in position 0: invalid start byte

何を意味するか

ファイルやバイト列を UTF-8 として読もうとして、UTF-8 では許されないバイトに当たったという意味です。位置とバイト値が文言に書かれており、多くは Windows から来た cp1252 や euc-kr の CSV、そもそもテキストでない画像や zip、解凍し忘れた gzip です。本当のエンコーディングを調べて encoding= で渡すのが正解で、errors="replace" は読み終えられますがそのバイトが疑問符に変わり、データは静かに壊れたまま先へ進みます。

直しかた

一行の命令では終わりません。何を見るべきかを説明に書いてあります。

出す道具
python
Python
18

Python のトレースバックは答えを二つに分けて置きます — 最後の一行が何が誤りかを、その上のフレームがどこで誤ったかを示すので、最後の行だけ読むと名前は分かって場所を落とします。とくに NoneType や KeyError のように値が無くて出る誤りは、落ちた場所より、その値を作った上のフレームに原因があります。

エラーメッセージの読み方

  • 一行目から読みます。下に行くほど道具の内部の話で、原因はたいてい一番上に書かれています。
  • ファイル名と行番号があればそこが出発点です — スタックの最上段ではなく、自分が書いたファイルが出てくる一番上の行です。
  • 文句はそのまま検索します。ただし自分のパスや変数名は消します — その部分が検索を邪魔します。
  • 同じ事情が道具の版ごとに違う言い方で出ます。結果が合わないときは版番号も入れてみます。
  • 直す命令を貼る前に、その命令が何を捨てるかを確かめます。取り消せないものが混ざっています。

よくある質問

Q. UnicodeDecodeError: 'utf-8' codec can't decode byte 0xff in position 0: invalid start byte はどういう意味ですか。

ファイルやバイト列を UTF-8 として読もうとして、UTF-8 では許されないバイトに当たったという意味です。位置とバイト値が文言に書かれており、多くは Windows から来た cp1252 や euc-kr の CSV、そもそもテキストでない画像や zip、解凍し忘れた gzip です。本当のエンコーディングを調べて encoding= で渡すのが正解で、errors="replace" は読み終えられますがそのバイトが疑問符に変わり、データは静かに壊れたまま先へ進みます。

Q. どう直しますか。

一行の命令では終わりません。何を見るべきかを上の説明に書いてあります。

Q. どの道具が出すエラーですか。

python です。Pythonの仲間で、文句は13語です。

近いエラー