点开这篇文章的,大概率是正在准备大厂数据分析师笔试的同学。网易考拉最早是跨境电商业务,后来被网易卖掉,但在2020年那会儿,考拉还是网易体系内重要的电商板块。网易2020校招数据分析师(考拉)提前批的笔试,是很多想去电商方向做数据的同学绕不开的一套题。这篇文章我会把这套笔试题的题型结构、考点重点、备考方法全部拆开讲,从命题逻辑到具体解题思路,再到面试衔接,尽量还原我当时准备和复盘这套题的全过程。
这套笔试对谁最有参考价值?第一类是准备投递电商、零售、互联网大厂数据分析岗的应届生;第二类是准备跳槽但想摸底自己水平、补一补业务分析短板的在职同学;第三类是正在规划数据分析师学习路线、想了解大厂到底考什么的新手。无论你属于哪一类,这篇文章都能帮你少走不少弯路。
1. 网易考拉数据分析师笔试的整体设计与出题逻辑
1.1 从岗位JD反推笔试考点
先看网易考拉数据分析师这个岗位的实际工作内容,能反推出笔试考察的能力模型。电商数据分析师日常做的事情,无非是这几类:销售日报和周报的分析、用户行为漏斗分析、大促活动效果评估、库存和供应链数据支持、商品品类分析、用户分层与生命周期运营。这些日常工作对应的能力项,就是笔试要考察的能力项。
笔试通常不会指望你直接写出完整的业务分析框架,而是通过具体的题型来筛选你是否具备三个基本素质:第一,数据敏感性,也就是看到一堆数字时能否快速发现异常;第二,逻辑推导能力,能否把一个复杂业务问题拆成可计算、可验证的小问题;第三,工具基本功,SQL和Excel是不是真的用到过,而不是只背过概念。
网易的校招笔试有一个特点,它不像阿里那样专门考很难的算法题,也不像腾讯那样侧重产品思维,而是更偏向“数据岗位的基础素养综合卷”。选择题考统计和概率,SQL题考实操能力,案例分析题考业务逻辑。这套组合拳,本质上是在模拟一个数据分析师入职后前三周可能遇到的工作场景。
1.2 试卷整体结构与时间分配的实战策略
我当时参加的那场网易考拉提前批笔试,时间大概在90分钟到120分钟之间,题量不算特别大,但覆盖面很广。大致分成三块:
第一部分是行测类选择题,大约20道左右,包括言语理解、数字推理、图形推理。这部分很多人会忽略,觉得跟数据分析没什么关系,但实际上数字推理题考察的是数列感,图形题考察的是空间和逻辑抽象能力,这些恰恰是后续工作中做特征工程、发现数据规律时必备的思维底子。
第二部分是专业选择题,大概15到20道,集中在概率论与数理统计、SQL查询输出、业务指标计算、A/B测试基础这几个方向。概率题比重不小,比如常见的“抛硬币连续出现正面次数期望”、“两个正态分布变量比较均值是否显著”这类问题。这部分考察的是统计直觉,因为做数据分析天天要跟显著性、置信区间打交道。
第三部分是两道大题,一道SQL题,一道业务案例分析题。SQL题通常给两张或三张表,要求完成一个相对复杂的查询,考察多表连接、聚合函数、窗口函数的熟练度。业务案例分析题一般是从某个实际业务场景出发,比如“考拉某品类最近两周转化率下降了5%,你会如何分析”,考察的是拆解问题、建立分析框架、提出落地建议的能力。
时间分配的实战策略是:行测题限时20分钟内做完,不管会不会都不要卡壳太久。专业选择题限时30分钟,概率统计的题如果一时没思路,先跳过,别在一道题上耗10分钟。SQL题和案例分析题各留20到25分钟,因为大题是按步骤给分的,写不全也比空白强。
1.3 为什么提前批笔试比正式批更像“压力测试”
提前批和正式批有一个很大的区别:提前批的目标是在正式秋招开始前,提前锁定一批优质候选人。所以提前批的笔试题往往更灵活、更考验临场反应,而不是单纯考知识记忆。
考拉提前批笔试里有些选择题会故意挖坑,比如给出一个电商领域的指标“客单价”,选项里混入“订单总金额/下单用户数”和“订单总金额/支付用户数”,这两个公式只差一个词,但含义完全不同。考的就是你有没有做过真实的业务报表,而不只是背过“客单价=GMV/用户数”这种粗糙公式。
另一个常见的坑是SQL题中的空值处理。很多同学在练SQL时用的都是比较规范的数据集,NULL值比较少,但真实电商数据里空值非常常见。题目如果不说清楚“小明没有购买记录时如何展示”,很多人的第一版SQL就会漏掉全额保留用户信息的条件。这块能力不是靠考前突击能补上的,而是平时写SQL时有没有真正处理过脏数据。
我要提醒一句:提前批的笔试结果如果通过了,后续面试时会带着你的笔试卷子去看,尤其是SQL题和案例分析题。面试官会针对你在卷子上写的答案追问细节。所以别想着在网上搜到参考答案直接背,一旦被追问就会露馅。
2. 核心考点拆解:概率统计、SQL与业务指标
2.1 概率统计题怎么避开常见陷阱
概率统计是专业选择题的绝对大头,也是很多人丢分重灾区。网易考拉数据分析师笔试里,以下几类概率题出现过很多次:
第一类是古典概型与期望计算。比如“甲乙两人轮流抛一枚均匀硬币,甲先抛,谁先抛出正面谁获胜,求甲获胜概率”。这个题的关键是意识到游戏有无限轮次的可能,要用等比级数求和。设甲在第一轮获胜概率是1/2,若第一轮两人都没抛出正面(概率1/4),则游戏重启,所以P(甲胜)=1/2+1/4×P(甲胜),解得P=2/3。这种题考的不是公式记忆,而是能不能想到用递推思路处理无限过程。
第二类是条件概率与贝叶斯公式。典型场景是“某商品推荐算法误判率已知,商品真实点击率已知,求用户点击后真的是因为推荐算法起作用的概率”。这类题容易搞混先验和后验,需要画一个简单的决策树或者列概率表来辅助推算,光靠心算很容易算反。
第三类是统计推断与置信区间。比如“某活动页面的转化率为2%,样本量为5000,求转化率的95%置信区间”。这不是让你背公式,而是考察是否理解标准误差的概念。p=0.02,标准误SE=sqrt(p(1-p)/n)=sqrt(0.02×0.98/5000),约等于0.00198,95%置信区间大约是0.02±1.96×0.00198,也就是(0.0161, 0.0239)。
一个很容易被忽略的点是中心极限定理的适用条件。有的题目会挖坑:样本量只有20,问能否用正态分布近似算置信区间。正确思路是当np和n(1-p)都大于5时才可以近似,样本量20且p接近0或1时不能直接套正态近似。
2.2 SQL题:从考试到实战的关键一跃
网易考拉的SQL题风格偏向实际业务,不会考特别刁钻的语法,而是考你能不能把业务需求翻译成正确的查询逻辑。记得有一道题大约是给订单表和商品表,要求统计每个品类下销售额排名前3的商品。这道题的核心是窗口函数ROW_NUMBER()或RANK(),配合PARTITION BY品类分组。
还有一类高频SQL题是留存率计算。典型场景给用户活跃表(user_id, login_date),要求计算某天的新用户在后一天的留存率。这类题的思路是先把新用户找出来,再和次日的活跃用户做内连接,最后计算保留比例。很多人第一反应是用JOIN,但用IN和EXISTS也能做,只是在大数据量下性能会有差异。
SQL题真正的难点往往在于空值处理和去重逻辑。电商场景里,同一用户在同一秒可能提交了重复订单,如果直接COUNT(*)会把重复计算进去,需要先根据订单号或渠道去重。还有一类业务场景是“用A表和B表关联,要求A表全部保留,B表为空时补0”,这时候LEFT JOIN比INNER JOIN更合适,而且要用COALESCE处理空值。
语法层面还要注意MySQL和Hive SQL的差异。笔试环境如果提示是Hive SQL,要记得用LIMIT子句而不是SQL Server的TOP写法;窗口函数的写法在两套引擎里基本一致,但在Hive中要留意是否开启了Hive窗口函数支持。这些细节直接影响能不能在规定时间内写出可运行的答案。
这里补充一个实操技巧:笔试环境里的SQL题通常只有一个文本输入框,没有真实的数据环境可以验证结果。所以平时练习时一定要养成“在人脑里跑一遍查询”的习惯,检查JOIN方向、聚合粒度、NULL处理这三个环节。很多人写SQL题时思路是对的,但JOIN方向反了,或者GROUP BY字段和SELECT字段不一致,导致结果错得离谱。
2.3 业务指标计算题:公式背后是业务理解
业务指标计算是电商数据分析岗笔试的特色题,也是很多只懂技术不懂业务的同学容易失分的地方。比如题目给你一组订单表和用户表,让你计算“支付转化率”和“客单价”,给出的字段里既有付款时间也有下单时间,那就要判断这个转化率的定义到底是什么。
做这类题时,我建议按以下顺序进行:
- 确认分子分母的业务定义,是“支付用户数/下单用户数”还是“支付订单数/下单订单数”,两者适用的分析场景不同;
- 确认时间口径,是按自然日还是按营业日,是否要考虑时区问题;
- 确认去重粒度,一个用户下了两单,算一个用户还是两个订单;
- 写出计算SQL或者公式,验证口径是否符合题目要求。
很多同学的误区是只要公式长得差不多就选,实际上笔试的得分点就在这些细节上。比如“复购率”的定义,电商行业通常指在某段时间内购买两次及以上的用户在总购买用户中的占比,而不是“同一用户在不同时间段的重复购买次数”,这两个口径算出来的数字差很多。
还有一类题是“GMV异常下降,从哪个指标开始拆”。正确的分析顺序是从底层用户行为指标往上层财务指标推,先看访客数有没有下滑,再看转化率有没有下降,最后看客单价是否变化。这套指标拆解逻辑在网易考拉笔试和后续面试里反复出现,务必练熟。
3. 业务案例分析题的高分答题思路
3.1 拆解问题的三步法:从现象到根因再到对策
网易考拉笔试的案例分析题,一般会给一段业务背景描述,然后问“你怎么分析”或者“你会如何解决”。这种题的评分标准往往很主观,但高分答案都有共同的特征:结构清晰、逻辑完整、能落地。
我总结了一个三步法,百试百灵:
第一步,定义问题。把业务现象翻译成可度量的指标变化。比如“某品类转化率下降5%”,先确认是哪个渠道、哪个品类、哪个时间段下降了,是环比下降还是同比下降,是偶发波动还是稳定趋势。不要一上来就找原因,先把问题的边界划清楚。
第二步,拆解原因。从“人、货、场、价、端”五个维度展开假设。人的维度看是不是目标人群发生变化,货的维度看是不是商品供给或库存出问题,场的维度看是不是流量结构变化或活动力度减弱,价的维度看是不是竞争对手调价导致相对价格上升,端的维度看是不是App或H5页面出现故障导致用户体验下降。
第三步,提出验证方案和数据需求。每一条假设都要对应一个验证方法。比如如果怀疑是价格竞争力下降,就拉取核心竞品的同款商品价格对比数据;如果怀疑是页面故障,就查看性能监控平台的错误率和耗时数据。这一步能体现出候选人真正的数据分析思维,而不只是会写SQL。
案例分析题的高分答案要像一份简易的数据分析项目计划书,有背景、有假设、有验证方法、有预期结论。哪怕数据和真实情况不一定相符,面试官也能从你的答题框架里看出你到底有没有做过电商数据分析。
3.2 从业务场景反推数据需求的表达能力
案例分析题拉分的部分在于:你能否用业务语言和数据语言同时表达同一个问题。这其实是数据分析师日常工作中最核心的能力,向上汇报时需要说业务价值,向下拆解时需要说数据逻辑。
比如网易考拉跨境电商业务,你会遇到“清关时效对复购率影响”这类需要结合行业特色的题。回答时既要提到物流时效是跨境电商用户体验的关键环节,也要有数据拆解思路:按清关时长分桶,对比不同分桶用户的复购率差异,同时控制客单价、品类、新老客等干扰变量,用分层分析或回归模型量化物流时效的影响。
这里推荐一个答题模板,笔试和面试都可以用:先说业务背景和目标,再说分析思路和数据准备,接着说具体分析方法,最后说预期洞察和建议。这个模板能保证你在写答案时不遗漏关键维度,也不会想到哪写到哪。
3.3 用结构化公式对付开放型问题
有些开放型问题可能会问“如何预估考拉‘双11’大促某品类的GMV”。这种估算题是咨询公司和行为面试里常见的考察方式,在数据分析笔试里也偶尔出现。解决思路是先拆公式:GMV=流量×转化率×客单价,然后分别给出每个因子的估算逻辑。
流量可以拆成自然流量和广告投放流量,自然流量参考平日均值和双11历史增幅,广告流量根据预算反推预期点击量;转化率参考历史大促转化率和日常转化率的比值;客单价参考历史大促客单价的均值并考虑品类结构变化。最后把三个数相乘,并给出一个上下浮动区间。这种题目不要求答案多准确,而是看你的拆解逻辑是否合理、有没有考虑周全。
4. 备考准备路线:从真题到能力闭环
4.1 分阶段备考方案:两周突击与长期积累
根据目标时间不同,准备策略也要调整。如果是还剩两周就要笔试,属于突击状态,这时候不建议从头到尾啃统计学教材,而是直接刷真题和模拟题,以题带知识点,错一题补一个知识点。这时候要抓大放小:SQL窗口函数、概率递推题、业务指标计算是三个最核心的得分点,一定要尽量熟练掌握。
如果是距离笔试还有一两个月,属于常规准备,建议按下面这个学习线路走:第一周复习统计学核心概念,重点看假设检验、置信区间、贝叶斯公式、期望与方差;第二周刷SQL题,按难度递进,从单表查询到多表连接再到窗口函数;第三周练业务分析框架,每天看一个电商数据分析的公开案例;第四周做套题模拟,限时完成,训练做题节奏。
我特别推荐大家用“真题反向整理法”来备考:每做完一套题,把所有错题按考点归类,比如“概率递推错3题”“SQL空值处理错2题”,这样复习时就能直接看到自己的薄弱环节,比盲目刷新题高效得多。这个方法我在准备网易笔试时用了,效果很明显。
4.2 需要熟练到本能的工具性技能
笔试只是第一关,后面还有面试,但笔试成绩会直接影响面试官问你什么。如果笔试的SQL题得了接近满分,面试官大概率会默认你SQL基本功扎实,转而去考察业务分析和沟通表达。反过来,如果SQL题做得不好,面试时大概率会被追问SQL,而且会明显带着“我要试探你的水平”的审视态度。
所以备考阶段有几项工具性技能需要熟练到“本能在反应”的状态:
一是窗口函数的常规用法,包括ROW_NUMBER、RANK、DENSE_RANK、LEAD、LAG,以及PARTITION BY和ORDER BY配合使用时的语义。
二是常见统计检验的判断逻辑,包括什么时候用t检验、什么时候用卡方检验、什么时候用方差分析,以及正态性检验在其中的位置。
三是Excel里vlookup、透视表、常用图表类型的选择。虽然笔试不怎么考Excel,但面试手撕case时经常要求你当场用Excel拉数据、做分析。
四是业务指标口径的快速推算能力。看到一张订单表,能立即想到各种指标的计算公式,不需要翻文档。
4.3 面试衔接:从笔试答案到面试追问
笔试和面试之间不是割裂的。网易考拉数据分析师的面试官,尤其是业务面的面试官,往往会在面试开始前快速浏览你的笔试卷子,针对几个答得没那么好的题目展开追问。这意味着笔试结束之后,你要做的第一件事不是对答案,而是把每道题重新做一遍,尤其是做错的题,要想清楚正确的解法,并且能用口头表达的方式讲给别人听。
我自己当时的做法是:笔试结束后趁记忆还热,把整份卷子的题目和答案重新整理成一份笔记,每道题标注知识点、解题思路、易错点。这份笔记后来在面试复习时发挥了很大作用,比从网上找别人整理的面经更有针对性。
另一个需要注意的点是,面试官追问时通常不只问“这题怎么做”,还会问“这个场景如果换了条件,结果会怎么变”,考察的是你是否真正理解了解题逻辑。比如SQL题里用了窗口函数,那面试官可能会问窗口函数和GROUP BY的本质区别是什么,各自作用在什么场景。
5. 常见问题与避坑经验
5.1 笔试现场最常踩的四个坑
第一个坑是时间分配失衡。很多同学在行测题上死磕一道图形推理题,结果后面SQL大题只剩5分钟,只能草草写两句。我建议行测题统一限时,到了时间还没做出来直接蒙一个选项,不要恋战。分析题和SQL题才是真正拉开差距的地方。
第二个坑是SQL语义写错但自我感觉良好。常见错误有:LEFT JOIN的右表有重复记录导致结果翻倍,GROUP BY字段和聚合函数混用导致逻辑混乱,窗口函数里的ORDER BY方向写反。这些错误在笔试环境中因为没有数据回显,很难发现,所以平时练习就要养成限定“先写子查询确认数据粒度,再写主查询”的习惯。
第三个坑是案例分析题只写假设不写验证方案。很多人的答案列了十几个可能的原因,看起来内容很多,但没有一个说明“怎么验证”,这在面试官眼里等于什么都没说。正确做法是每个原因配一个验证数据源和一个判断标准。
第四个坑是忽略“业务边界”。比如题目问“考拉某类目大促后转化率反而下降”,如果没有考虑大促后的用户构成变化(羊毛党比例升高、真实需求用户被透支),很容易得出错误结论。答案里加上“排除干扰因素”这类描述,会明显提升专业度。
5.2 考前一周的复习清单
考前一周不建议再刷新题了,而是把做过的所有错题重新过一遍,重点记忆那些因为粗心导致失误的题目。可以给自己做一张“考前速查表”,列上概率分布的期望和方差公式、常用假设检验方法、SQL窗口函数的基本写法、电商核心指标的计算口径,考前半小时只看这张表。
另外强烈建议大家提前登录笔试系统,测试一下网络和浏览器兼容性。有些在线笔试平台只支持特定浏览器,到了考试当天才发现打不开就太冤了。这个操作只需花10分钟,却能避免相当大的情绪波动。
如果时间允许,可以找同学或者朋友模拟一次限时笔试,用真实的题量和时间压力做一次预演。不是为了测知识点,而是为了感受“2分钟做不完一道题时应该果断跳到下一题”的状态,这种考场决策能力也是需要练习的。
5.3 数据分析师学习路线规划的额外建议
最后回到一个更大的话题。网易考拉这套笔试题,其实只是数据分析师学习路线中的一个小节点。如果你未来想真正在这个岗位上长期发展,我建议在校期间就把“业务理解能力”放在和技术能力同等重要的位置。
技术能力决定你能不能入行,业务理解能力决定你能走多远。同样是做留存分析,初级分析师停留在“计算周留存和月留存”,高级分析师会结合用户生命周期、品类偏好、内容消费时长等维度做一套完整的用户价值分层模型,并给出具体运营动作建议。这种差距不是靠刷题刷出来的,而是靠对业务场景的持续观察和积累。
平时可以多关注一些电商数据分析的公开案例,试着用自己的话把分析方法讲清楚。面试官问到“你平时怎么学习数据分析”时,如果你能分享自己拆解过的一个具体业务案例,会远远好于背一堆学习方法论。
笔试只是第一关,后续还有业务面、HR面、交叉面,每一步都在筛选更匹配的人。把自己当成一个“懂业务的数据分析师”来定位和准备,你会发现备考的每一份努力,都在为面试积累素材。我个人的体会是,与其焦虑能不能过这道门槛,不如踏实把每道题的逻辑吃透、把每一种业务场景的分析框架练熟,能力到位了,岗位自然水到渠成。