摘要:多模态学生留存数据集是一个面向大学生辍学风险预测、学生留校分析与智能教育管理的多模态教育数据集,共包含 2,134 条匿名大学生记录。
数据集概述
多模态学生留存数据集是一个面向大学生辍学风险预测、学生留校分析与智能教育管理的多模态教育数据集,共包含 2,134 条匿名大学生记录。数据模拟真实大学校园服务环境,将GPA、出勤率、学分、人口统计及助学金等结构化信息,与学业咨询笔记、辅导记录等非结构化文本以及过去四个学期的学业表现时间序列进行融合,可从学业、行为、经济和校园支持等多个维度刻画学生状态,为提前发现潜在辍学学生和制定个性化干预策略提供数据基础。
数据结构与关键特征
该数据集主要由结构化表格数据、非结构化文本数据和时间序列数据组成:结构化特征涵盖当前及历史GPA、学分、学业警告、年龄、性别、专业、助学金状态、入学空档期和顾问会议等;文本部分包含学术顾问咨询摘要及可选的学生辅导记录;时间序列部分记录过去四个学期的GPA和出勤率变化。目标变量较为丰富,包括 dropout_risk、下一学期辍学概率、dropout_type、dropout_duration 和辍学原因,可同时支持风险分类、概率预测、辍学类型识别、持续时间估计和原因分析等多任务学习。
应用价值与研究方向
该数据集适用于学生留存风险预测、学业预警、多模态教育数据融合、时间序列学生建模和智能干预决策等研究。研究人员可采用XGBoost、LightGBM等方法处理结构化数据,利用BERT或其他语言模型提取咨询文本语义,通过LSTM、Transformer分析多学期成绩与出勤变化,并进一步使用多模态Transformer或图神经网络融合学生、课程、教师及咨询关系;还可研究辍学原因解释、风险动态变化、跨学期预测、学生群体关联、可解释预警以及面向高校管理系统的个性化留校干预推荐。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-498
文件大小:68K
原创声明:本数据集为整理作品