python · Python
メッセージ
UnicodeDecodeError: 'utf-8' codec can't decode byte 0xff in position 0: invalid start byte
何を意味するか
ファイルやバイト列を UTF-8 として読もうとして、UTF-8 では許されないバイトに当たったという意味です。位置とバイト値が文言に書かれており、多くは Windows から来た cp1252 や euc-kr の CSV、そもそもテキストでない画像や zip、解凍し忘れた gzip です。本当のエンコーディングを調べて encoding= で渡すのが正解で、errors="replace" は読み終えられますがそのバイトが疑問符に変わり、データは静かに壊れたまま先へ進みます。
直しかた
一行の命令では終わりません。何を見るべきかを説明に書いてあります。
- 出す道具
- python
- Python
- 18
Python のトレースバックは答えを二つに分けて置きます — 最後の一行が何が誤りかを、その上のフレームがどこで誤ったかを示すので、最後の行だけ読むと名前は分かって場所を落とします。とくに NoneType や KeyError のように値が無くて出る誤りは、落ちた場所より、その値を作った上のフレームに原因があります。
エラーメッセージの読み方
- 一行目から読みます。下に行くほど道具の内部の話で、原因はたいてい一番上に書かれています。
- ファイル名と行番号があればそこが出発点です — スタックの最上段ではなく、自分が書いたファイルが出てくる一番上の行です。
- 文句はそのまま検索します。ただし自分のパスや変数名は消します — その部分が検索を邪魔します。
- 同じ事情が道具の版ごとに違う言い方で出ます。結果が合わないときは版番号も入れてみます。
- 直す命令を貼る前に、その命令が何を捨てるかを確かめます。取り消せないものが混ざっています。
よくある質問
Q. UnicodeDecodeError: 'utf-8' codec can't decode byte 0xff in position 0: invalid start byte はどういう意味ですか。
ファイルやバイト列を UTF-8 として読もうとして、UTF-8 では許されないバイトに当たったという意味です。位置とバイト値が文言に書かれており、多くは Windows から来た cp1252 や euc-kr の CSV、そもそもテキストでない画像や zip、解凍し忘れた gzip です。本当のエンコーディングを調べて encoding= で渡すのが正解で、errors="replace" は読み終えられますがそのバイトが疑問符に変わり、データは静かに壊れたまま先へ進みます。
Q. どう直しますか。
一行の命令では終わりません。何を見るべきかを上の説明に書いてあります。
Q. どの道具が出すエラーですか。
python です。Pythonの仲間で、文句は13語です。