以下是关于数据清洗的全部内容,持续更新。
zhon避坑最关键的一点:它不是分词器,也不是中文语义模型,而是一个提供中文字符常量的 Python 包。很多坑都来自定位错了。你以为它能“理解中文”,它其实只是在帮你把汉字、标点、拼音这些边界整理得更规整。
猫猫猫猫猫对比看着像数猫,真正容易出错的却是字符、空格和编码。本文用一组可复现的内容导入案例,还原从发现重复标签、核对原始字符串,到定位尾部空格并完成清洗的全过程,顺手讲清字符数、字节数和搜索匹配为什么不是一回事。
← 查看全部标签