定性数据与定量数据识别指南:描述性统计实战解析
2026/9/8 14:11:15 网站建设 项目流程

判断数据从哪里开始错的,我这些年反反复复见到新人甚至不少业务方栽在同一件事上:产品数据报表里把“用户评分”当数字求了平均值,把“年龄”当连续变量塞进回归模型,或者拿着两份不同量纲的指标非要比大小。追根溯源,多半是在第一步就错了——根本没搞清手里的数据是定性还是定量。这篇内容不绕弯子,直接从定性数据和定量数据的识别讲起,再落到描述性统计里那些最常用、也最容易被误用的分析手段,全程配合例子和实操口径,适合刚接触数据分析的运营、产品、市场同学,也适合想系统梳理一遍统计基础的分析师。

1. 拿到数据先问一句:它到底在描述什么

数据分析第一步永远不是急着跑模型、画图表,而是把手里的数据老老实实分个类。按照统计学里的经典分法,数据先分两大类:定性数据和定量数据。听起来简单,但实际判断时很多人都凭感觉走,看到数字就以为是定量,看到文字就以为是定性,这种直觉在多数时候是错的。

1.1 定性数据:本质是分类,不是数字

定性数据,也叫分类数据或品质数据,它描述的是事物的属性、类别或者特征。关键判断标准就一条:数字本身没有大小意义,只代表分类标签。比如性别,你可以记作1男2女,但你绝不能说2比1大,更不能算出“平均性别是1.3”;再比如省份代码、设备型号、支付方式、职级名称,都属于定性数据。

定性数据内部还要再细分为两类。一类是定类数据,类别之间没有顺序关系,像颜色、性别、品牌,你把它排列成任何顺序都不影响逻辑;另一类是定序数据,类别之间有相对高低或前后关系,比如满意度里的“不满意、一般、满意”,教育程度里的“高中、本科、硕士、博士”,这类数据能比大小、能排序,但说不清楚等级之间的间隔是多少。注意,这两类虽然都属于定性,但在后续分析时权限完全不同:定序数据可以做“更高/更低”的判断,定类数据只能做“是否相同”的判断。

1.2 定量数据:有单位、有间隔、可以算数

定量数据,也叫数值型数据,特征是数据本身有实际度量意义,可以做加减乘除。典型的有收入、年龄、订单金额、响应时长、点击次数。定量数据内部同样分两类:离散型连续型

离散型数据只能取某些特定的整数或有限值,比如“一年内的购买次数”,你不可能花0.5次;连续型数据在某个区间内可以取任意值,比如身高、体重、响应时间的毫秒数,理论上可以无限细分。这个区分直接影响后面选统计方法,比如计算中位数对两种都合适,但做某些精确建模时,离散和连续的处理方式会很不一样。

一个实用的判断口诀:定性数据回答“是什么类别”,定量数据回答“是多少数量”。

实战中还有一个特别容易混淆的场景。比如“年龄”看起来是定量,确实也是,但在题目设计里如果问你“年龄段是 A. 18-25 B. 26-35”,然后再让你分析,这时候问卷回收来的其实是定序数据,而不是精确年龄,因为你丢失了具体数值,只保留了等级信息。同样的原始变量、不同的收集方式,直接决定了数据是定性还是定量,这一点尤其坑人。

1.3 为什么要分这么细:后续每个操作都依赖这个判断

分类不只是一个理论洁癖,它直接决定后续的一切。描述性统计里,计算平均值只对定量数据有意义;算频率和占比,主要用在定性数据上;做相关分析,定量和定量用Pearson相关系数,定序和定序用Spearman;做可视化的图层选择,定性数据适合柱状图、饼图,定量数据适合直方图、箱线图、散点图。方向一错,后面的所有结论可信度都归零。

可以这样想:定性数据像汽车的方向盘和挡位——只有状态、模式,没有加减速的连续性;定量数据像速度表和油量表——有精确刻度和物理单位,能算“多多少”“快多少”。你把方向盘拧了两格然后问“平均拧到几格”,这就完全跑偏了。

2. 定性数据的描述性统计:频率、占比和那个不常被提起的众数

定性数据的分析工具没有定量数据那么多花活,核心逻辑就一条——数个数、算比例。但即使这么简单,实操中的偏差依然层出不穷。

2.1 频数和频率:描述定性的第一语言

一组定性数据里,每种类别出现的次数叫频数,频数除以总数得到频率,也就是占比。比如调查100个用户的注册渠道,其中App渠道45人、网页渠道35人、小程序20人,那频数分别是45、35、20,频率分别是45%、35%、20%。

这里有一个高频错误:用频数直接比较时忽略了总数不一致。A组样本100人,某类有60人;B组样本200人,某类有100人,单看频数B组更多,但占比反而是A组高。凡是跨组比较定性数据,一律先换算成频率或百分比再说话,这是铁律。

2.2 众数:定性数据的“平均值”

很多人一想到平均值就默认是算术平均,但对定性数据来说,平均值根本没有意义,真正对应的是众数——出现次数最多的那个类别。比如产品反馈里“加载慢”出现最多,那众数就是“加载慢”,这是整体用户感受最主要的倾向。

众数有个特点要注意:它不一定唯一。数据分布可能有两个甚至多个类别次数并列最高,这叫双峰或多峰分布,这个时候简单说“整体主流偏好是什么”就不够严谨,得把这几个众数都摆出来。

2.3 做定性数据表格和图表时的注意事项

表格展示定性数据,常规做法是列出每个类别的频数和百分比,并按降序排列,方便一眼抓住头尾。图的话,柱状图和条形图是最稳的选择,饼图最好在类别不超过6-7类时使用,类别太多时饼图切得密密麻麻根本没法看。

另外,针对定序数据有个额外的展示优势:可以累计百分比。比如技能等级里“初级、中级、高级”的占比分别是30%、40%、30%,那“达到中级及以上水平”的累计占比是70%,这个信息在人才结构分析里非常有用。而纯定类数据做累计没有实际意义,“华南+华东+华北的累计占比”基本说明不了什么问题。

3. 定量数据的描述性统计:集中趋势与离散程度,二者缺一不可

定量数据的描述性统计是日常分析里用得最多、也最容易飘的地方。常规分析一般分两路走:一路看集中趋势,回答“数据整体在哪个水平”;一路看离散程度,回答“数据围绕这个水平波动得有多厉害”。

3.1 集中趋势:均值、中位数、众数各管一摊

均值是最直觉的“平均水平”,把所有值加起来除以个数。但均值有一个著名的致命弱点——对极端值极其敏感。100个人的月收入,99个人是5000块,1个人是5万块,算出来均值约5450,这个“平均水平”对绝大多数人根本没有参考意义。这种右偏(长尾在右侧)的分布下,均值会被拉高,它反映的其实是“总盘子除以总人数”的算术结果,而不是“典型个体水平”。

中位数是排序后处在正中间的那个值,它的优势在于不受极端值干扰。还是刚才那组收入数据,中位数是5000,这才是更符合“一个典型用户的收入”的直觉值。所以分析收入、房价、时长这类天然右偏的数据时,中位数优先于均值。

众数在定量数据里也能用,尤其是对离散型数据看“最常见的值是多少”。比如分析“每个用户每周打开App的次数”,众数是3次,均值可能是4.2次,众数给出的信息是“最典型的单一行为模式”,和均值、中位数互补使用。

3.2 离散程度:平均值不骗人,但平均值会藏东西

只看均值容易翻车,因为两组数据的平均值可能几乎一样,内部结构却天差地别。比如两个渠道的订单处理时长均值都是10分钟,但A渠道每一单都稳定在10分钟左右,B渠道一半订单2分钟、一半订单18分钟,均值一样,体验完全不同。所以衡量离散程度的指标不可跳过。

最直观的离散指标是极差,最大值减最小值,计算简单但只用了两个极端点,信息量很少。更稳的是标准差方差——描述的是每个数据点和均值之间的平均偏离程度。标准差越小,数据越集中;标准差越大,波动越剧烈。但标准差有个问题:它的量纲和原数据一样,比大小没问题,想对比两个不同量纲变量的波动程度时就用不了。这时需要掏出变异系数(CV),也就是标准差除以均值,它能做无量纲的比较。

举个例子:想对比“商品价格”和“日销量”哪个波动更大,直接比标准差没意义,因为价钱的数字大、销量的数字小,量纲不同。但各自算完变异系数之后再比,就公平了。

3.3 分布形态:偏度和峰度,判断数据是否“正态”的初步依据

描述性统计里另两个常用指标是偏度峰度。偏度描述数据分布的对称性——偏度为0代表分布对称,正偏(右偏)说明长尾在右侧,负偏(左偏)说明长尾在左侧。峰度描述的是分布“尖”的程度,用来衡量数据在均值附近的聚集程度和尾部分布的厚度。

为什么要关注这两个指标?因为它们决定后续能不能用基于正态假设的统计方法。很多参数检验(比如t检验、方差分析)要求数据近似正态分布,偏度和峰度的绝对值通常作为初步判断依据。注意,这里说的是近似,很多“完美正态”在实际业务数据里几乎不存在,尤其是用户行为类的漏斗数据,天然就是偏态甚至长尾分布。大多数情况下,看到偏度绝对值大于1或者峰度远超3,就要认真考虑数据是否需要做变换(对数变换、Box-Cox变换等)或者改用非参数方法。

4. 描述性统计常规分析的操作框架:图、表、指标一起上

单独拿一个指标说事是新手最容易干的事——只报一个均值就下结论。描述性统计的常规做法,应该是“图+表+指标”三位一体,互相印证,才能形成对数据的完整认识。

4.1 通用分析流程:先画像,再细看,后对比

我的习惯是分为三步走:

第一步,先给整个数据集拍一张“快照”:

  • 定性数据看类别数、频数表、占比;
  • 定量数据看样本量、均值、中位数、最小值、最大值、标准差;
  • 顺手看一下缺失值情况,缺失比例高的字段要标记出来。

第二步,针对关键定量指标做分布透视:

  • 画直方图或箱线图,直观检查分布形态、极值位置、是否存在离群点;
  • 结合偏度、峰度判断数据是否适合继续做参数分析。

第三步,按业务维度拆开对比:

  • 比如按渠道、按用户类型、按时段切分后,重复上面的描述性统计;
  • 这里重点提醒:别只看各组的均值,一定要把各组的标准差或中位数也列出来,否则很容易得出“看起来差不多但实际结构完全不同”的错误结论。

4.2 常用图表的选型逻辑

图是给人看的,选图的本质是让读者用眼睛完成一次快速统计。下面是我常用的选型逻辑:

  • 定性数据单变量:柱状图/条形图(看频数或占比),饼图(类别少时的占比快览);
  • 定性数据双变量:堆叠柱状图(看组间构成差异);
  • 定量数据单变量:直方图(看分布形态)、箱线图(看中位数、四分位数、离群点);
  • 定量数据双变量:散点图(看相关趋势);
  • 定量数据分组对比:分组箱线图或小提琴图。

箱线图值得重点说。一张箱线图把最小值、下四分位数、中位数、上四分位数、最大值以及离群点全画进去了,对比多个分组的分布结构时是信息密度最高的单一图表。我几乎在所有探索性分析里都会先来一张分组箱线图,很多规律一眼就能看出来,再去做复杂的建模,方向不会跑偏。

4.3 不同数据类型组合下的描述性统计方案速查

实际项目中常常是定性+定量混在一起,这里给出一张我经常引用的对照表,方便直接对号入座:

场景数据类型推荐描述性统计方案
用户画像频道构成定类频数、占比、条形图
满意度等级分布定序频数、占比、累计占比
价格/收入/时长的整体水平定量(右偏)中位数、四分位数、箱线图
转化率波动分析定量(连续)均值、标准差、变异系数、折线图
各渠道订单金额对比定量分组分组箱线图+各组均值/中位数/标准差
新老用户活跃度对比定量分组独立样本t检验前先做描述性对比

这张表的核心思路是:数据类型决定统计口径,统计口径决定图表和指标,所有环节一条线走到头。

5. 实战中的高频坑:定性定量分析的错用实录

再往下聊点真正有价值的东西,这些坑我几乎每年都能在评审会上看到,值得单独拿出来讲。

5.1 均值明明更“高级”,为什么我却劝你多报告中位数

业务方天然喜欢均值,因为“平均”好理解、好汇报。但均值只有在数据分布接近对称时才足够有代表性。很多业务数据——收入、价格、时长、单量——都是右偏分布,头部一小部分人拉高了整体均值,中位数才是“大多数人的水平”。

报告里我的惯例是同时给出均值和中位数,并解释为什么两者有差距。均值远大于中位数就说明数据往高值端偏,头部效应明显;两者接近则说明分布相对对称。这个简单动作能规避掉大量的业务决策误判,因为决策者看的往往不是统计形态,而是你对数字的解读方式。

5.2 离群值到底删不删?先搞清楚它是“脏数据”还是“真实极端”

分析时遇到离群值总是很纠结。我的经验是不要一刀切,先分三类看:

  1. 录入或采集错误:比如年龄填了200、金额出现了负数,这类属于脏数据,直接剔除或修正;
  2. 真实但极端的业务现象:比如大促期间的巨额订单,这类属于业务真实值,要看分析目标决定是否排除;
  3. 系统本身的长尾:比如用户分布里天然的少量极重度用户,这类是分布的一部分,不能随便删。

判断方法很简单:结合业务上下文看。如果分析“日常客单价”,那大促订单可以考虑剔除或单独分组;如果分析“总体营收结构”,那这部分必须保留。改数据之前一定在分析文档里写清楚“为什么删、删了多少”,这是专业素养问题。

5.3 百分比和百分点是两个量纲,别互相混淆

A渠道转化率从5%提升到6%,这不叫“提升1%”,叫“提升1个百分点(pp)”,如果叫“提升1%”会被人理解为原基础的1%,也就是从5%变成5.05%。这一字之差在业务汇报里的偏差非常大。常规做法是把“绝对变化”用百分点表述,“相对变化”用百分比表述——上面的例子是提升1个百分点,相对提升了20%。两个口径都对,但必须说清楚用的哪一个。

5.4 分组细看时,辛普森悖论随时会跳出来

有一种情况特别反直觉:整体趋势和分组趋势完全相反。比如新老用户各自的转化率都比上个月高,但合在一起的总转化率反而下降了。原因是两组用户的占比结构发生了变化——低转化率的那组用户占比大幅上升,把整体拉下来了。这就是辛普森悖论。

遇到这种矛盾,解决方式只有一个:拆开看,报告里同时交代“整体”和“分组”两层口径,并解释结构变化。不要只挑对自己有利的那一层汇报,那是数字游戏,不是数据分析。

6. 动手写一份高质量描述性统计报告的清单

最后给一个可以直接抄作业的报告结构清单。不管是用Excel、Python、SPSS还是R,描述性统计报告的骨架是一样的。按这个清单走,至少能保证分析完整、结论可信:

第一层:样本说明

  • 数据来源、采集时间、样本量、有效性如何
  • 缺失值的比例和处理方式

第二层:变量清单与类型标注

  • 把所有变量列出来,并标注定性/定量、定类/定序
  • 这一步的意义在于给自己和读者一张“地图”

第三层:核心变量逐一描述

  • 定性变量:频数、占比、众数
  • 定量变量:均值、中位数、标准差、最小值、最大值、偏度、峰度

第四层:交叉与分组描述

  • 选择与业务问题最相关的分维度进行拆解
  • 跨组比较时优先用频率而非频数

第五层:可视化配合

  • 每个核心结论配一张图,图能独立表达结论
  • 图不要过度装饰,坐标轴、单位、图例必须清晰

第六层:结论与数据口径说明

  • 列出2-3个最重要的描述性发现
  • 写清楚结论基于哪一层口径,是否受离群值或结构变化影响

这份清单看起来平实,但真的能防止起码七成的低级分析失误。

我个人这几年做下来最深的体感是:描述性统计看起来“简单”,实际上是对业务理解深度的考验。均值、标准差、频数这些人人都能算,但能不能判断出“这里该用中位数而不是均值”“这里的占比差异究竟受什么结构影响”,靠的全是分析者对数据类型和业务场景的准确把握。先把每一个变量是什么类型这件事刻进肌肉记忆,后面所有高级分析都会稳得多。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询