🏠 返回首页 🧪 实验列表

📝 文本分类仿真实验

环节一:感知体验
1
2
3
4
5
6
7
环节一:感知体验
💡 实验目标:了解文本分类是什么,知道AI如何"读懂"文字并归类

🎯 环节1 实验目标

  • 能说出文本分类在生活中的至少3个应用场景
  • 理解文本分类的4个基本步骤:分词→特征匹配→加权计算→类别判定
  • 理解"特征词"和"权重"在AI分类中的作用
  • 完成后续环节,亲手标注数据并训练自己的分类模型

🤔 什么是文本分类?

文本分类是自然语言处理(NLP)中最基础也最重要的任务之一。让计算机自动判断一段文字属于哪个类别。

📧 邮件分类
自动识别垃圾邮件
📰 新闻推荐
按主题推送内容
💬 舆情分析
判断公众情绪倾向
🛒 商品评论
自动归类好评差评
🔍 客服分流
自动识别用户问题类型

⚙️ AI文本分类的四步流程

1

分词

将文本拆分为词语单元,提取关键特征词

2

特征匹配

将词语与各类别的特征词库进行匹配

3

加权计算

根据词频权重计算每个类别的总得分

4

类别判定

选取得分最高的类别作为分类结果

这些特征词和权重从哪来的?—— 答案就是训练数据! 在接下来的环节中,你将亲手标注数据、训练模型,理解AI学习的全过程。

环节一:感知体验
🎯 实验目标:选择一个分类场景,体验系统内置AI模型的分类效果

第一步:选择分类场景

😊

情感分类

判断文本表达的情绪是正面、负面还是中性

商品评论 · 留言评价
📰

主题分类

判断文本属于学习、生活、娱乐还是科技主题

文章归类 · 内容推荐
🚫

垃圾信息分类

识别文本是正常信息还是垃圾广告/诈骗信息

短信过滤 · 广告识别
📅

事件分类

分析文字描述的事件类型(校园活动/体育/灾害等)

事件识别 · 新闻摘要
💬

意图分类

分析句子的意图是提问、请求、抱怨还是建议等

客服分流 · 对话理解
环节二:数据标注
🎯 实验目标:亲手给数据打标签,理解"训练数据"是AI学习的基础

🎯 环节2 实验目标

  • 认识什么是"数据标注"——给每条文本分配正确的类别标签
  • 完成所有待标注文本的标注(至少标注 6 条)
  • 理解标注质量直接影响AI模型的效果

📋 数据标注任务

下面是情感分类场景的待标注文本。
请仔细阅读每条文本,判断它属于哪个类别,然后点击对应的标签按钮。

标注进度 0 / 0
0%

📝 待标注文本列表

类别:

环节三:模型训练与验证
🎯 实验目标:用标注数据训练自己的分类模型,观察特征权重如何生成

🎯 环节3 实验目标

  • 亲手点击训练按钮,见证AI如何从数据中"学习"
  • 观察训练结果:每个特征词在不同类别中的权重
  • 理解"词频越高,权重越大"的简单原理

🧠 模型训练中心

你标注了 0 条数据,涵盖 0 个类别。
点击下方按钮,让AI从你的标注数据中学习特征规律!

环节三:模型训练与验证
🎯 实验目标:用自己训练的模型对新文本进行分类,检验模型效果

🎯 测试目标

  • 输入至少 3条 新文本,测试自训练模型
  • 观察分类结果中的关键词匹配和得分
  • 思考:模型的分类结果和你的预期一致吗?为什么不一致?

🔬 测试你的模型

输入一条新的文本(不在你标注过的数据中),看看你训练的模型能否正确分类。

已输入 0 字
环节三:模型训练与验证
🎯 实验目标:对比自训练模型和系统模型,反思数据质量对AI的影响

🎯 反思目标

  • 完成至少 1次 两个模型对比测试
  • 理解为什么训练数据越多、质量越高,模型效果越好
  • 总结自己的实验收获,完成实验记录

⚖️ 模型对比分析

下面是你的模型和系统内置模型的对比。通过对比,你能发现训练数据的量和质如何影响AI。

🤖 你的模型

训练数据:0

特征词数:0

💡 数据量少 → 特征覆盖不全面

🏭 系统内置模型

训练数据:数千条

特征词数:0

💡 数据量大 → 特征覆盖全面

💡 实验思考题

1. 你标注的数据越多,模型的分类能力会变强还是变弱?为什么?

2. 如果你的标注有错误(比如把"正面"标成了"负面"),会对模型产生什么影响?

3. 你觉得系统内置模型为什么比你的模型更"聪明"?

4. 通过这个实验,你对"AI需要数据来学习"这句话有了怎样的理解?

🎉 恭喜完成实验!回顾你在每个环节的成果

📊 实验成果总览

🏆 实验目标达成情况