开始之前,先说说这份试卷为什么值得翻出来看看
2019年京东春季校招的数据分析岗试卷,放在今天回头看,依然有很强的参考价值。不是说题目有多新,恰恰相反,它考察的东西——SQL取数、指标拆解、业务归因、AB实验设计——在六年后的数据分析面试中依然是主流。甚至可以说,当下很多大厂数分岗的笔试,核心逻辑和这份试卷是一脉相承的。
我当时拿到这份试卷的第一感觉是:它不考偏题怪题,不考编程语言语法细节,而是用京东自己的业务场景(电商、物流、用户增长)来包装每一道题。这意味着什么?意味着它考察的不是“你会不会写代码”,而是“你能不能带着业务视角去用数据解决问题”。这套考察逻辑,正是数据分析岗位日常工作的真实映射。
这篇文章会带你把这份试卷的核心考点逐层拆开,从SQL到统计,从指标体系到业务案例分析,每一部分我都会给出解题思路、踩坑提醒和实操心得。不管你是正在准备大厂数分岗校招的应届生,还是工作两年想跳槽的初级数据分析师,这篇文章都能给你一套可以直接对照复盘的备考框架。
1. 京东数据分析笔试的整体定位与考察逻辑
1.1 从试卷看京东对数分岗的能力预期
先聊一个很多人忽略的点:笔试不是单纯考知识,它在筛“适不适合干这行”。
京东那份试卷,前几道题基本锁定在SQL和数据处理上,中间穿插统计推断和概率计算,最后落到一两道业务分析大题。这个结构透露出的岗位预期非常清晰——数据分析师不是纯技术岗,也不是纯业务岗,而是两者的交汇点。你得能从数据库里把数取出来,还得能把这些数变成业务决策依据。
对比一下同期的其他大厂试卷会更明显。有的公司侧重机器学习算法推导,有的公司侧重产品Sense和A/B测试设计,京东这份卷子则更偏向“电商业务分析师”的画像:SQL必须熟练,统计要能落地,业务逻辑要清晰。它的业务场景设定通常围绕GMV变动归因、促销活动效果评估、用户分层运营效果分析、供应链库存周转这类电商核心问题展开。
所以你在复习时,就别花太多精力去啃那些偏算法的深度内容了。把SQL窗口函数练熟,把假设检验和AB实验的流程吃透,再配合一套业务分析框架去练案例题,基本就能覆盖这份试卷90%的考察面。方向对了,努力才有效。
1.2 题型分布与分值权重透露出的复习优先级
我根据考过同学的回忆和公开的帖子,整理了这份试卷大致的题型结构。虽然版本不完全一致,但分布逻辑是一致的:基础数据处理能力占大头,业务分析能力紧随其后,统计和概率穿插其中。
| 题型 | 大致占比 | 考察核心 |
|---|---|---|
| SQL取数与数据清洗 | 30%-35% | 多表关联、聚合、窗口函数、去重 |
| 概率统计与AB实验 | 20%-25% | 假设检验、置信区间、实验设计 |
| 指标体系与业务理解 | 15%-20% | 指标口径、漏斗拆解、归因分析 |
| 业务案例主观题 | 25%-30% | 分析框架、逻辑表达、落地建议 |
这个分值分布说明了一个问题:SQL和业务案例加起来占了半壁江山。如果时间有限,这两个板块的优先级最高。统计部分虽然占比不小,但考察的深度通常是应用层的,不会让你手推复杂公式。至于概率题,主要看你有没有基本的统计直觉。
另外注意一个细节:这套试卷是限时的,通常90到120分钟要完成上面所有题目。时间紧张意味着你不仅要会做,还要做得快。很多人栽在最后的大题上,不是不会分析,而是前面小题耗时太久。这个策略问题我后面会专门展开说。
2. SQL与数据提取:绕不开的第一道门槛
2.1 京东场景下的SQL考点:从取数到业务口径
京东的SQL题和LeetCode那种纯算法题完全是两码事。它不会扔给你一张员工表和一张部门表让你join一下完事,而是模拟一个电商业务场景,比如订单表、用户表、商品表、促销活动表——然后问你“计算2023年第一季度各品类的复购率”或者“找出客单价高于品类平均值的前100个SPU”。
这种题目表面上考SQL语法,实际上在考两件事。第一,你能不能把业务问题翻译成SQL逻辑。第二,你懂不懂电商数据背后的口径和坑。比如“复购率”就有好几种口径,按用户算还是按订单算,时间窗口定在多少天,新客要不要排除——口径不同,答案完全不同。笔试里通常不会明确告诉你这些细节,你需要自己定义并在答案里写清楚。
我见过太多人在这一步翻车:SQL写得很顺,但口径考虑不周,比如没排除测试订单和异常退款单,或者没处理同一天多笔订单的去重逻辑。这些细节恰恰是京东这种规模的公司特别在意的,因为日常业务决策依赖的数据报表,一点点口径偏差都会被放大。
2.2 高频题型拆解:留存、复购、GMV拆解
结合试卷实际考点和后续考生反馈,我整理了三个最高频的SQL题型和解法。
第一类:用户留存分析。给你一张用户登录记录表,让你计算某日新增用户在第7天的留存率。核心逻辑是先圈定新增用户(当天首次登录),再LEFT JOIN第7天还有登录记录的用户,最终按时段分组计算比例。这里的常用技巧是DATE_DIFF函数配合条件聚合,或者用窗口函数对每个用户计算首次登录日期。
-- 以2023-01-01新增用户7日留存为例 WITH new_users AS ( SELECT user_id, MIN(login_date) AS first_login FROM login_log GROUP BY user_id HAVING MIN(login_date) = '2023-01-01' ) SELECT COUNT(DISTINCT n.user_id) AS new_user_cnt, COUNT(DISTINCT CASE WHEN l.login_date = DATE_ADD(n.first_login, INTERVAL 7 DAY) THEN n.user_id END) AS retained_cnt, COUNT(DISTINCT CASE WHEN l.login_date = DATE_ADD(n.first_login, INTERVAL 7 DAY) THEN n.user_id END) / COUNT(DISTINCT n.user_id) AS retention_7d FROM new_users n LEFT JOIN login_log l ON n.user_id = l.user_id第二类:复购率分析。区别在于需要定义“购”的维度,是订单ID还是下单次数,以及时间窗口。推荐在SQL里用带注释的子查询把口径写清楚,哪怕代码长一点,阅卷人看了会觉得你有业务sense。
第三类:GMV拆解。比如“统计2023年6月各一级类目GMV环比变化及贡献度”。这题单纯用SUM + GROUP BY就能完成80%,但如果你想拿高分,就要多算一步“各品类GMV变化对大盘GMV变化的贡献率”。这需要在拆解时保留上月GMV、本月GMV、差额、贡献率这几个字段,而不是只交一个汇总表上去。
2.3 手写SQL的答题规范和细节技巧
笔试现场手写SQL和你在本地编辑器里写完全不一样,没有自动补全,没有报错提示,写错了就是错了。几个实操细节分享给你。
第一,养成写WITH子句的习惯。复杂逻辑拆成一段一段的临时表,既方便自己理清思路,也方便阅卷人看懂你的解题链路。不要在一条SELECT里堆十几个CASE WHEN,那会给阅卷人留下“逻辑混乱”的负面印象。
第二,时刻关注NULL值的处理。LEFT JOIN 后右表字段大概率出现NULL,COUNT、SUM、AVG这些聚合函数对NULL的处理又各不相同。比如AVG会忽略NULL行,但如果你用SUM/NULLIF(COUNT,0)手动计算平均值,NULLIF就非常关键。这些细节在笔试题里经常成为区分度。
第三,写完SQL务必检查边界条件。日期临界点是否包含当天,金额单位是元还是分,订单状态是否需要过滤“已支付”——每个动作背后都可能影响最终结果。我常用的检查方式是:结果先做总量级估算,看看算出来的数是不是符合常理。比如“日活5000万”这种量级在京东场景下是合理的,如果算出来5万,那一定哪里出了问题。
3. 统计基础与AB实验:别背公式,要理解业务含义
3.1 假设检验在电商场景中的实际落地
统计部分京东这份试卷不会让你手推中心极限定理的证明,而是给一个业务场景,让你判断用什么方法、为什么、怎么解读结果。典型的题目长这样:“促销页改版后,我们观察到点击率从2.0%提升到2.3%,请问这个提升是否显著?应该用什么检验方法?需要注意什么?”
这道题的考点拆开来看有三层。第一层,识别问题类型:点击率属于二项分布数据,样本量足够大时可以用Z检验,更严谨的做法是用卡方检验或两比例检验。第二层,解释显著性水平与P值:P值小于0.05只说明在统计意义上拒绝原假设,但不代表实际业务效果一定显著(需要结合效应量)。第三层,指出常见陷阱:样本量是否事先计算,两组的流量分配是否随机,有没有辛普森悖论的可能。
答题时我建议按“原假设→备择假设→检验方法→样本量→结果解读→业务建议”这个顺序写,逻辑链条完整。比如:
原假设H0:改版前后点击率无差异(p1 = p2);备择假设H1:改版后点击率显著提升(p1 > p2)。本场景属于大样本二分类比例检验,可采用两比例Z检验。显著性水平取0.05,检验功效设为0.8,事前计算每组所需样本量不低于8600。实际结果显示P值<0.001,在95%置信水平下拒绝H0,认为改版对点击率有显著正向影响。考虑到置信下限为0.2个百分点,虽然统计显著但业务提升幅度有限,建议结合运营成本综合判断是否全量上线。
你看,同样是结论,这个回答把方法选择、样本量估算、结论边界和业务建议都覆盖到了。阅卷人一眼就能看出你是有实战经验的人,而不是只会背公式。
3.2 AB实验设计题目:从分组到评估的完整流程
AB实验的完整流程是京东数据分析岗笔试和面试的共同重点。记住标准套路:确定实验单位(用户还是请求)→ 确定指标(核心指标+护栏指标)→ 计算样本量 → 随机分组 → 设定实验周期 → 上线观察 → 显著性检验 → 结果解读与决策。
笔试中最常考的两个点是样本量计算和实验周期。样本量计算涉及一个公式:n = (Zalpha + Zbeta)^2 * 2 * p * (1-p) / (p1 - p2)^2。如果在笔试中给出提升阈值的场景,你要能直接把数字代入算出来,这属于基本功。
实验周期这块有个坑。很多人以为实验跑满7天就够了,但实际要考虑一周的周期性波动(工作日vs周末)和用户行为延迟效应(新用户需要激活期,老用户可能受到新奇效应影响)。所以笔试里如果问“实验要跑多久”,正确答案通常不是“7天”,而是“至少覆盖一个完整业务周期(如7天),且要照顾到行为延迟,通常建议14天或21天,并在上线第3天、第7天分别做一次中间检查”。
3.3 概率题与业务直觉
概率部分通常不会太难,但会披着电商外衣。比如“某商品加入购物车后购买的概率为30%,三个独立用户加入购物车,至少一人完成的概率是多少”——这就是1 - (1-0.3)^3 = 0.657,考的是概率论基础。
这类题想全对不难,就怕你在“独立”这个假设上栽跟头。现实业务里用户行为从来不是完全独立的,但笔试默认在理想条件下计算,别把问题复杂化。我做这类题的习惯是,先判断是不是独立事件,再看是“至少”还是“恰好”,最后再套公式。每道题我都在草稿上写清楚这两个判断,再动笔算。
4. 业务案例分析题:拉开差距的地方
4.1 案例题的三种典型出题形式
案例分析题在试卷中的权重最高,也是最难临时抱佛脚的部分。京东的案例题通常从以下三种形式中选。
形式一:指标异动归因。比如“某品类6月GMV环比下降12%,请分析可能原因”。这种题的考察核心是归因逻辑和拆解能力。你不能一上来就猜“是因为竞品搞活动”,而是要把GMV按“流量×转化率×客单价”拆开,再层层下钻到“新客/老客”“各品类/各品牌”“各渠道/各区域”,最后结合内外部因素给出假设清单。
形式二:业务方案设计。比如“设计一套会员召回方案,目标是在预算有限的情况下最大化召回率”。这种题考察的是方案设计能力和数据预估能力。你要把目标人群分层、触达方式、成本测算、预期效果、监控指标都说清楚,尤其是用什么数据指标衡量方案是否成功。
形式三:指标体系搭建。比如“为一个同城零售业务设计核心指标体系”。这种题要你从北极星指标出发,拆分出用户获取、转化、留存、履约、供应等模块的关键指标,并给出各指标之间的逻辑关系。
4.2 高分答题框架:假设驱动+数据验证+落地建议
无论案例题长什么样,我都推荐用“三步法”来组织答案。这套框架我从实际写分析报告的经验里提炼出来,笔试和面试都适用。
第一步,明确问题边界。把题目里模糊的表述转化成可量化的问题。比如“GMV下降了”,你要反问自己:下降的起点是什么时候、对比口径是什么、哪个品类最先异动?在纸上写清楚问题边界,后续回答就不会跑偏。
第二步,分层拆解+假设列表。用MECE原则把问题拆成互斥且穷尽的子项,再针对每个子项给出可能的假设。以GMV下降为例:流量端口(DAU、访问深度)、转化端口(浏览→加购→下单各环节转化率)、客单端口(件单价、连带率)。每个拆分维度下再列出具体假设,比如“首页改版导致入口流量大幅下滑”“某个大促活动结束后用户需求被提前透支”。
第三步,验证方式+落地建议。这一步最体现经验,因为你要说明用什么数据去验证假设。比如“用渠道漏斗日志确认各环节转化率,用分品类日销趋势图定位异动爆发点”。验证完毕后,还要给出可操作的改进建议,而不是停留在“建议优化流量结构”这种空话。例如:“建议次日上线首页核心入口回归A/B测试,同时针对流失最大的品类启动定向促销,预算控制在50万以内,评估周期为7天。”
4.3 结合京东业务特色的回答思路
京东的业务是“零售+物流”一体化的,这意味着数据分析不只盯着前端流量转化,还要关注供应链效率和履约成本。笔试案例题偶尔会涉及“单均履约成本上升如何归因”“库存周转天数异常怎么分析”这类偏供应链的题目。
如果遇到这类题,你要把“采购—仓储—配送—售后”全链路的关键指标串起来。采购端看采购周期和批次规模,仓储端看周转天数和滞销占比,配送端看妥投时长和运力利用率,售后端看退货率和逆向物流成本。带着这个链路去拆解,比你孤立地分析某一环节要全面得多。
即便题目本身是典型的电商前端问题,你在回答最后如果补一句“同时要关注这个指标变动对复购和用户口碑的长期影响”,也能让阅卷人感受到你理解京东“零售+物流”闭环的商业模式,而不只是盯着前台GMV看。
5. 备考策略与常见失分点复盘
5.1 刷题之外,更要练的是“限时决策”
很多人在准备时把重点放在刷题上,但缺少“限时模拟”这个关键环节。京东这份试卷90到120分钟,题目量不小,我第一次模拟时前面的SQL题抠了太久,最后一道案例分析题只写了三行字。后来我调整了策略:先花3分钟通读全卷,评估每道题的时间成本,先做自己最有把握的题,再做需要思考的题,案例题至少留出25分钟。
这个时间分配策略让我多拿了至少15%的分数。笔试不仅是考你会不会,还考你在有限时间内能不能稳定发挥。我建议你在复习后期至少做三次完整限时模拟,每次结束后认真复盘:哪类题耗时超标,哪类题容易卡壳,哪些知识点在紧张状态下就容易空白。
5.2 高频失分点清单
结合试卷反馈和我自己踩过的坑,整理了一份高频失分点清单,对照自查。
| 失分点 | 具体表现 | 应对方法 |
|---|---|---|
| SQL口径不清 | 未说明剔除退款/测试订单,留存定义含糊 | 答案开头先写口径假设,再写SQL |
| 统计方法误用 | 小样本用Z检验,无视正态性假设 | 先判断数据类型和样本量,再选检验方法 |
| 案例题空谈 | 只列原因不给验证方法,建议不可落地 | 每个假设配一个数据验证方案和量化结论 |
| 答题缺乏结构 | 想到哪写到哪,阅卷人抓不住重点 | 按“结论→证据→行动”顺序组织答案 |
| 疏于复查 | 计算题单位错误,SQL拼写错误 | 留5分钟检查,重点看单位、日期边界和空值处理 |
第五点“疏于复查”是很多人最容易忽略的,但它可能是性价比最高的一项。笔试那种高压环境下写出来的代码,多多少少会有小毛病:漏了个逗号、日期没加引号、表名写错。留出几分钟从头扫一遍代码,成本极低,但可能帮你把“会做”变成“得分”。
5.3 从“会做题”到“能拿offer”的最后一公里
笔试只是第一关,它的成绩直接影响你能不能进面试。站在出题人角度想,这份试卷真正想筛选的人,不是SQL写得多华丽的,而是“遇到业务问题时能形成闭环”的人。所谓闭环,就是从问题定义、数据提取、分析方法、结果验证到策略建议,跑完整个链路。
因此我建议你在备考阶段就刻意用“闭环思维”来对待每一道练习题。每次做完一道SQL题,强迫自己再用三句话解释这个查询结果对业务意味着什么;每写一道案例题,逼自己给出数据验证方案而不是堆假设。长期这样练习,你会发现笔试中的主观题越写越顺,因为它们不过是你日常分析工作的小型复刻。
如果你想在案例分析题上再精进一步,可以主动找一些公开的电商数据集练手,比如公开的订单流水数据。用SQL跑出每日GMV趋势,尝试做一次GMV下降归因分析,再把结论写成一页PPT式分析报告。这个过程模拟了笔试案例题从取数到结论的完整链路,也是我个人认为最有价值的备考方式之一。
写在最后:这类试卷考察的核心是一种“数据直觉”
说到底,京东2019春招这份数据分析试卷,和市面上各种“数分笔试100题”最大的区别在于:它不是拼知识储备,而是拼数据直觉。数据直觉不是靠背题背出来的,而是靠你不断用数据去解释真实业务问题、再拿数据结果去检验业务判断的循环来养成的。
根据我个人带新人和当时备考的经验,如果能完整走一遍“SQL取数→统计推断→案例归因→方案落地”这个闭环,你对数据分析岗位的认知会比刷一百道题更扎实。这份试卷最好的用法,不是考前刷一遍找手感,而是把它当作一面镜子——找到自己最薄弱的环节,然后针对性地去补。数据这条路上没有捷径,但你走过的每一个坑,都会变成未来面试和工作中实实在在的竞争力。