简介:聚焦疫情话题下人民日报与微博数据的两极情感分析,面向自然语言处理学习者、数据科学初学者及有情感分析需求的研究者,提供从数据获取到模型构建的完整参考。压缩包共2000个文件,大小约87.47MB,包含大量txt文本数据、Python源码、json/html/csv中间结果以及pkl模型文件,并附有docx论文文档和图片图表,整体结构清晰,目录分类明确。目前已有433人学习下载,可用于论文撰写、课程设计或实际项目借鉴。内容涵盖完整的毕业论文文档、Python项目源码及数据,覆盖微博与人民日报疫情相关话题的数据采集、情感词典与机器学习两类分析路径的对比,并配有按日期组织的关键词结果页面,便于快速复现实验、扩展语料或调整模型,进而深入理解训练语料质量对情感分类性能的影响。
1. 疫情话题数据的两极情感分析:为什么全网情绪会走向对立
2020 年初的某个深夜,我盯着屏幕上爬下来的几万条微博,发现一个奇怪现象:同样一条“武汉封城”的消息,评论区里有人喊“终于重视了”,有人骂“为什么不早这么做”。这不是个例,而是整个疫情期间中文互联网情绪的常态——极度焦虑和极度感动同时出现,中立的声音反而被淹没。用传统的单极情感打分模型去做这批数据,结果惨不忍睹:要么全被归为负面,要么模型在正负之间反复横跳。这个场景就是“基于机器学习的人民日报和微博等与疫情有关话题数据两极情感分析”这个方向要解决的核心问题:不去预测一个笼统的“正/负”,而是把同一话题下的情感拆成两个独立维度,分别度量正面强度和负面强度,还原真实舆论场里的对立与撕裂。
这个方向适合三类人:一是做舆情监测的从业者,需要判断某一事件是“一边倒”还是“两极分化”;二是研究社会情绪演变的社科研究者,需要量化数据支撑;三是刚入门机器学习的开发者,想找一个真实、有挑战性、数据集可得的情感分析项目练手。难点不在分类本身,而在于“两极”这个设定——它不是简单的多分类,而是要你重新思考情感标签的标注方式和模型输出层的设计。下面我按自己趟过的路,把从数据清洗到双通道模型实现的全过程拆开讲。
本文还有配套的精品资源,点击获取