极客前沿

AI入门:一步步微调mBERT做文本分类

2026-07-08 01:34
DEV Tutorial
查看原文

学会安装Python、Hugging Face库,运行代码微调多语言BERT模型,完成一个文本分类任务。

这篇教程带你从零开始,用mBERT(一个能理解104种语言的预训练模型)做一个文本分类器。整个过程在CPU上就能跑,大约15-20分钟。你不需要GPU,也不需要懂深度学习原理。

准备环境

先确保你的电脑上安装了Python 3.8或更高版本。如果还没有,去python.org下载并安装。安装时记得勾选“Add Python to PATH”。

然后打开命令行(Windows是cmd或PowerShell,Mac是终端),输入以下命令安装必要的库:

  • pip install transformers datasets torch scikit-learn pandas
  • 如果下载慢,可以加镜像:pip install -i https://pypi.tuna.tsinghua.edu.cn/simple transformers datasets torch scikit-learn pandas

安装完成后,输入python进入Python交互环境,输入from transformers import BertTokenizer,如果没有报错,说明环境就绪。

下载代码和数据集

打开浏览器,访问这个GitHub仓库:https://github.com/udgithubit/hinglish-toxicity-bert-bilstm。点击绿色的“Code”按钮,选择“Download ZIP”。解压后,你会看到一个hinglish-toxicity-bert-bilstm-main文件夹。

在命令行中,用cdcd 路径/到/hinglish-toxicity-bert-bilstm-main

运行训练脚本

文件夹里有一个train.py文件。在命令行输入python train.py,然后按回车。脚本会自动下载mBERT模型(首次运行需要几分钟),然后开始训练。你会看到进度条和损失值(loss)——损失值越小说明模型学得越好。

Tutorial Image

训练结束后,终端会打印出准确率(accuracy)和F1分数。如果这两个数字都接近0.96,说明模型表现不错。

常见坑:如果报错“ModuleNotFoundError”,说明某个库没装全,重新运行pip install命令。如果报内存错误,可以关闭其他程序再试。

验证结果

训练完成后,脚本会生成一个results文件夹,里面包含模型文件和测试结果。你可以用以下代码快速测试模型对新句子的判断:

from transformers import pipeline
classifier = pipeline('text-classification', model='./results')
print(classifier('you are stupid'))

输出会显示“toxic”或“non-toxic”以及置信度。

下一步可以做什么

现在你有了一个能识别Hinglish(印地语和英语混合)文本中是否包含辱骂内容的分类器。你可以尝试:

  • 用你自己的数据重新训练,比如中文社交媒体评论。
  • 调整max_length参数(默认128),如果你的文本更长。
  • 增加训练轮数(epochs),如果损失值还在下降。

记住:先跑通最简单的版本,再考虑更复杂的模型。

内容来源

DEV Tutorial

发布时间

2026-07-08 01:34

返回 AI技术