数据集处理相关文章
大规模图像数据集清洗与预处理:从TB级原始数据到训练就绪
处理大规模图像数据集时,去重、清洗、标准化格式是必不可少的步骤。本文介绍了使用 Python 多进程和 WebDataset 格式对 TB 级数据进行高效预处理的生产级方案。
文本数据清洗与 Tokenization 工具链搭建
高质量的训练数据是优秀模型的基础。本文分享了我在处理大规模中文文本数据集时使用的清洗流程:去噪、去重、质量过滤、分词与 Tokenization 的完整工具链搭建经验。
数据集标注工具对比:LabelImg / LabelStudio / CVAT 使用心得
数据标注是监督学习中至关重要的环节。本文对比了 LabelImg、LabelStudio 和 CVAT 三款主流标注工具在图像检测、分割任务中的使用体验,包括安装部署、标注效率与格式导出等方面。