文本分类是自然语言处理(NLP)中最基础也最重要的任务之一。让计算机自动判断一段文字属于哪个类别。
将文本拆分为词语单元,提取关键特征词
将词语与各类别的特征词库进行匹配
根据词频权重计算每个类别的总得分
选取得分最高的类别作为分类结果
这些特征词和权重从哪来的?—— 答案就是训练数据! 在接下来的环节中,你将亲手标注数据、训练模型,理解AI学习的全过程。
判断文本表达的情绪是正面、负面还是中性
商品评论 · 留言评价判断文本属于学习、生活、娱乐还是科技主题
文章归类 · 内容推荐识别文本是正常信息还是垃圾广告/诈骗信息
短信过滤 · 广告识别分析文字描述的事件类型(校园活动/体育/灾害等)
事件识别 · 新闻摘要分析句子的意图是提问、请求、抱怨还是建议等
客服分流 · 对话理解下面是情感分类场景的待标注文本。
请仔细阅读每条文本,判断它属于哪个类别,然后点击对应的标签按钮。
类别:
你标注了 0 条数据,涵盖 0 个类别。
点击下方按钮,让AI从你的标注数据中学习特征规律!
输入一条新的文本(不在你标注过的数据中),看看你训练的模型能否正确分类。
下面是你的模型和系统内置模型的对比。通过对比,你能发现训练数据的量和质如何影响AI。
训练数据:0 条
特征词数:0 个
💡 数据量少 → 特征覆盖不全面
训练数据:数千条
特征词数:0 个
💡 数据量大 → 特征覆盖全面
1. 你标注的数据越多,模型的分类能力会变强还是变弱?为什么?
2. 如果你的标注有错误(比如把"正面"标成了"负面"),会对模型产生什么影响?
3. 你觉得系统内置模型为什么比你的模型更"聪明"?
4. 通过这个实验,你对"AI需要数据来学习"这句话有了怎样的理解?