python · Python
오류 문구
UnicodeDecodeError: 'utf-8' codec can't decode byte 0xff in position 0: invalid start byte
무슨 뜻인가
파일이나 바이트열을 UTF-8로 읽으려 했는데 UTF-8이 아닌 바이트가 나왔다는 뜻입니다. 위치와 바이트 값이 문구에 적혀 있고, 윈도우에서 나온 cp1252·euc-kr CSV나 실제로는 이미지·zip인 파일, gzip을 풀지 않고 읽은 경우가 대부분입니다. 진짜 인코딩을 찾아 encoding= 으로 지정하는 것이 정답이고, errors="replace"는 읽히기는 하지만 그 바이트가 물음표로 바뀌어 데이터가 조용히 손상된 채 지나갑니다.
고치는 명령
한 줄 명령으로 끝나지 않습니다. 설명에 무엇을 봐야 하는지 적어 두었습니다.
- 내는 도구
- python
- Python
- 18
파이썬의 오류는 Traceback의 마지막 한 줄에 무엇이 틀렸는지, 그 위의 프레임들에 어디서 틀렸는지가 나뉘어 적혀 있어서 마지막 줄만 읽으면 이름은 알고 자리는 놓치게 되고, 특히 NoneType과 KeyError처럼 값이 없어서 나는 오류는 터진 자리보다 그 값을 만들어 준 위쪽 프레임에 원인이 있습니다.
오류 문구를 읽는 법
- 첫 줄부터 읽습니다. 아래로 갈수록 도구 내부 이야기이고, 정작 원인은 맨 위에 적혀 있습니다.
- 파일 이름과 줄 번호가 있으면 거기가 시작점입니다 — 스택의 가장 위가 아니라, 내가 쓴 파일이 나오는 가장 위 줄입니다.
- 문구를 그대로 검색합니다. 다만 내 경로와 변수 이름은 지웁니다 — 그 부분이 검색을 방해합니다.
- 같은 문구가 도구 판마다 다르게 나옵니다. 검색 결과가 안 맞으면 판 번호를 함께 넣어 봅니다.
- 고치는 명령을 붙여 넣기 전에 그 명령이 무엇을 버리는지 확인합니다. 되돌릴 수 없는 것이 섞여 있습니다.
자주 묻는 질문
Q. UnicodeDecodeError: 'utf-8' codec can't decode byte 0xff in position 0: invalid start byte 는 무슨 뜻인가요?
파일이나 바이트열을 UTF-8로 읽으려 했는데 UTF-8이 아닌 바이트가 나왔다는 뜻입니다. 위치와 바이트 값이 문구에 적혀 있고, 윈도우에서 나온 cp1252·euc-kr CSV나 실제로는 이미지·zip인 파일, gzip을 풀지 않고 읽은 경우가 대부분입니다. 진짜 인코딩을 찾아 encoding= 으로 지정하는 것이 정답이고, errors="replace"는 읽히기는 하지만 그 바이트가 물음표로 바뀌어 데이터가 조용히 손상된 채 지나갑니다.
Q. 어떻게 고치나요?
한 줄 명령으로 끝나지 않습니다. 위 설명에서 무엇을 봐야 하는지 적어 두었습니다.
Q. 어느 도구가 내는 오류인가요?
python입니다. Python 갈래에 있고, 문구는 13낱말입니다.