Python 编码转换:将未知编码文本转为中文
如果你不知道原始编码是什么,可以尝试使用 Python 的 chardet 库来自动检测编码。示例代码如下:
import chardet
text = b'\xb5\xe7\xd0\xc5\xd2\xbb\xcf\xb7\xc6\xf7\xa3\xac\xd6\xd0\xb9\xfa\xb1\xed\xce\xf3\xb5\xc4\xcc\xec\xbf\xda\xbf\xb4\xa1\xa3'
result = chardet.detect(text)
print(result['encoding']) # 输出检测到的编码类型
decoded_text = text.decode(result['encoding'])
print(decoded_text) # 输出转换后的文本
如果你已经知道原始编码类型,可以直接使用 Python 的字符串解码函数来将文本转换为中文格式。示例代码如下:
text = b'\xb5\xe7\xd0\xc5\xd2\xbb\xcf\xb7\xc6\xf7\xa3\xac\xd6\xd0\xb9\xfa\xb1\xed\xce\xf3\xb5\xc4\xcc\xec\xbf\xda\xbf\xb4\xa1\xa3'
decoded_text = text.decode('gb2312')
print(decoded_text) # 输出转换后的文本
请注意,如果原始文本包含无法解码的字符,解码操作可能会失败并引发 UnicodeDecodeError 异常。在这种情况下,你需要进一步分析原始文本并找出正确的编码方式来进行转换。
原文地址: https://www.cveoy.top/t/topic/oDSb 著作权归作者所有。请勿转载和采集!