Ludo Atlas · 管线 · 试玩测试管线¶
管线与工作流。定位:把「我觉得」换成「我看到」的最小纪律:每轮先立假设,用陌生人观察真实行为,按证据分诊反馈,改完再测。 配套:《制作管理手册》·《游戏设计手册》·《运营与增长手册》·《避坑大全》。
1. 定位与适用¶
自己人对自家游戏的判断会随时间失准:你知道每个按钮的用途,记得每处引导的用意,连哪里会卡住都提前替玩家想到了。试玩测试是把外部视角拿回来的手段:不回答「我们做得对不对」,只回答「目标玩家实际经历了什么」。
一句话定义:用真实目标玩家的真实行为,验证事先写下的假设。
三条底线,后文反复使用:
- 先有假设再有人:没有想验证的问题,这轮测试就不该开始(§3.1)。
- 看行为,不只听意见:玩家说什么便宜,做什么诚实(§3.4、§3.5)。
- 每轮小而频:5-8 人一轮,测完就改,改完再测(§3.6)。
适用范围与时机:
- 任何里程碑(原型、垂直切片、Alpha、Beta)的验收之前;
- 核心循环首次完整可玩之后,以及每次大改机制、数值、引导之后;
- 公开试玩(Demo、商店活动)之前,作为一次预演;内部对某个设计争论超过十分钟、双方都拿不出证据时。
边界划清:试玩测试不找 bug(那是 QA 流程,见《制作管理手册》§5),也不做大样本数据分析(那是上线后的遥测工作)。它管的是「人怎么理解、怎么上手、卡在哪、想不想继续」,样本小,深度高。
2. 工具链¶
原则:工具越轻越好,别为测试搭平台。一支笔、一张表、一段录屏就能开始,等真的测不过来再上更重的方案。
| 环节 | 常见选择 | 要点 |
|---|---|---|
| 招募 | 玩家社群、垂直论坛、线下聚会、远程约测 | 记录画像与联系方式;只用目标受众的陌生人(§3.2) |
| 知情同意 | 一页说明加录制授权 | 说清用途、隐私边界与退出方式;录制前确认 |
| 录屏 | 屏幕录制软件(OBS 这类)加麦克风 | 全场次录制;统一命名「日期-版本-测试者代号」 |
| 记录 | 带时间码的记录表(文档或纸笔) | 现场只记事实:时间、行为、原话 |
| 远程测试 | 视频通话加屏幕共享 | 网络不稳时改「录屏加异步回访」,不要硬测 |
| 事后问卷 | 短问卷,开放题为主 | 放在访谈之后;评分题不作为唯一证据 |
| 版本分发 | 独立测试构建,标清版本号 | 与开发版隔离;发出的版本与日期记录在案 |
| 行为埋点 | 死亡点、通过率、卡关点统计 | 辅助证据,与观察笔记互证;不独自下结论 |
补充说明:
- 记录表字段先定死:时间码、操作与行为、原话摘录、事件类型(卡住/误解/情绪/提问)。字段稳定,跨轮才能对比。
- 问卷不替代观察:问卷收玩家的自我认知,观察收真实行为,冲突时以行为为准(§3.5);埋点能提示「哪里出了事」,说不清「为什么」,归因来自观察与访谈。
3. 流程与规范¶
一轮完整的试玩按六步走,顺序不交换:假设 → 招募 → 脚本与任务 → 观察记录 → 分诊 → 修复与回归(下一轮验证)。
3.1 目标与假设先行¶
开测之前先写一张「测试卡」,一页以内,三样东西:
- 假设:我们相信[哪类玩家]在[什么条件]下能/会[做到什么或感受到什么]。
- 观察指标:如果假设成立,应该看到什么可数或可见的行为兆候。
- 决策规则:出现什么结果算通过、算失败;失败时改哪里。
示例:「我们相信首次接触的玩家不靠提示也会发现冲刺。若成立,多人任务里至少一半的人会主动用它;若不成立,先检查冲刺的提示与视觉表现,而不是先删功能。」
纪律:
- 一轮最多 2-3 个问题,按「最可能毁掉项目的假设」排序,先验证最贵、最不确定的那个。
- 「看看反应」「好不好玩」不是假设。写不出可观察的兆候,说明问题还没想清。
- 轮次类型决定脚本:概念轮(这个想法讲得通吗)、可用性轮(玩家能不能自己上手)、平衡轮(难度曲线与数值合理吗)、体验轮(情绪节奏对不对)。类型不同,人数与任务设计也不同。
3.2 测试对象:陌生人优先¶
一句话规则:目标受众的陌生人 > 一般玩家 > 朋友。原因与方法有关,与礼貌无关:
| 维度 | 朋友 | 陌生人 |
|---|---|---|
| 知道你想要什么答案 | 顺着你说好话 | 只对游戏本身反应 |
| 设计信息污染 | 听你讲过、玩过早期版本 | 从零开始,等同新玩家 |
| 卡住时的行为 | 硬撑,帮你找借口 | 按真实反应放弃或抱怨 |
| 反馈价值 | 情绪价值高,决策价值低 | 能当决策证据 |
- 每轮 5-8 人。同类问题在小样本里高度重复:前几个人暴露的问题,后面多半是同一批。人数不是关键,「都是目标受众的陌生人」才是。
- 招募时核对画像:玩不玩这个类型、每周玩多久、对这类操作熟不熟。硬核玩家测休闲向游戏,卡点清单里会混满错位问题。
- 保持新鲜度:同一测试者从第二轮起就不再是「新玩家」。里程碑级验证尽量每轮换人;必须复用时,隔开版本与时段并标注。
- 朋友不是完全不能用:资源紧张的原型期可以用,但要清楚这是「降级证据」,只能提出问题,不能宣布通过。里程碑验收与公开试玩前,结论必须由陌生人给出。
3.3 任务设计与提问禁忌¶
任务设计只有一条主轴:给目标,不给步骤。
- 给场景与目标:「想办法到达对面的平台」「把角色升到 3 级」「找到出口」。
- 不给操作提示:「按 A 跳两次」「先点这里」会划走玩家自己理解的过程,也划走这轮测试要观察的东西。
- 任务 3-5 个,覆盖核心循环;每个 5-10 分钟;开场先给 2-3 分钟自由探索,让玩家建立自己的直觉。
- 开场脚本固定三句话:测的是游戏不是你;遇到困难不用怕出丑;请把心里想的说出来。
提问与主持禁忌:
- 不问「好不好玩」「难不难」「喜不喜欢」:社交礼貌会替你回答。
- 不用引导式问法:「是不是提示不明显?」把答案写进了问题,玩家只会顺着答。
- 卡住时不立刻帮忙:卡住正是数据。给足沉默时间,实在卡死再按最小提示介入并记录(§3.4)。
- 不问假想题:「如果加了某个功能你会怎样」收上来的是许愿;改问真实行为与回忆:「刚才那一步你本来想做什么」。
- 玩家提问时,记录问题、不直接回答;把「玩家问了什么」整理成教程缺口清单。
3.4 观察与记录¶
记录的唯一纪律:记事实,不记感想。主持人的感想留到分诊阶段,现场只收四类事实:
- 卡住点:停顿超过 30 秒、同一处反复失败、来回绕路、操作明显变慢。
- 误解点:把 A 当成 B、去找不存在的功能、读错界面信息;事后追问「你当时以为这里是什么」。
- 情绪点:笑、叹气、骂、身体前倾、放下手柄。情绪是体验数据的原始形态。
- 提问点:玩家主动问出的每个问题,都是游戏没讲清的地方。
介入规则:默认不帮、不救、不解释。卡死(约 2-3 分钟毫无进展)时给最小提示,并记下提示等级与时间;被提示过的环节,分析时降权处理。
分工与做法:
- 两人配置最佳:主持人负责引导与访谈,记录员只盯行为与时间码,互不串岗。
- 单人测试先保证录屏完整,访谈放到回看之后,回看时补全时间码笔记。
- 访谈配合回放:请玩家边看录屏边讲当时在想什么;回忆加画面的证词,质量远高于凭空问答。
- 当轮笔记在 24-48 小时内整理完:记忆会自动美化,也会自动丢失细节。
3.5 反馈分诊:意见与行为分开¶
一场测试会收到四类输入,处理方式完全不同,先分拣再讨论:
| 输入 | 性质 | 处理 |
|---|---|---|
| 行为证据(卡点、误解、放弃点) | 最硬,可直接支撑决策 | 多人重复出现即进修复清单 |
| 玩家意见与建议 | 问题常是真的,方案常是错的 | 追问背后意图;方案基本不直接采纳 |
| 技术缺陷(崩溃、报错、显示异常) | 工程问题 | 转 bug 清单按级别处理 |
| 赞美与客套 | 情绪价值 | 不作为证据,感谢即可 |
分诊的判断规则:
- 先找重复:2-3 名目标玩家在同一点卡住,才够格动设计;单人单次的卡点先记录,看后续轮次是否复现。
- 改「信息与引导」优先于改「难度」:很多所谓太难,其实是没看懂要干什么。先补提示、改反馈、调镜头,再动数值。
- 建议挖需求:玩家说「加个自动寻路吧」,背后多半是「我迷路了」或「走路太无聊」。解决后者,不照抄前者。
- 与核心幻想冲突的建议先不改,但要验证是不是「玩家没理解你的意图」;若是表达问题,改表达,不改幻想。
- 每条反馈都要有处置:改/不改/待观察,并写明理由。收集一堆不处理,等于白测,还消耗测试者的善意(见 §5 第 3 条)。
3.6 迭代节奏:小轮次,快回归¶
节奏公式:一轮 5-8 人 → 分诊 → 修复清单 → 冻结新版本 → 下一轮;间隔以 2-4 周或一个里程碑为单位,跟版本节奏走,不跟心情走。
- 修复清单每轮限 5-7 项,按影响排序;改太多会失去归因能力,也赶不完。
- 版本纪律与回归:每轮构建冻结并标版本号,一边改一边测结论作废;上一轮修复项在下一轮列为「必看项」,由新玩家回归验证,未验证的修复不算完成。
- 停止条件:新的陌生玩家在核心任务上不再出现新的高频卡点,且里程碑验收标准达成。停止信号不是「没人提意见」,意见永远会有人提。
- 每轮留一页报告:测了什么、看到什么、改了什么、下轮验证什么。多轮积累就是项目的决策日志。
4. 自动化与验收¶
试玩本质是人的工作,没有全自动一说;但模板、记录、汇总与回归可以半自动化,把主持人的精力省给观察与追问。
| 环节 | 可半自动的部分 | 说明 |
|---|---|---|
| 模板 | 测试卡、记录表、问卷、报告模板固定化 | 复制即用,字段不走样,跨轮可比 |
| 归档 | 录屏与笔记统一命名、按轮次归档 | 「日期-版本-测试者」命名,顺手就能做 |
| 指标汇总 | 任务完成率、首次成功用时、卡点计数、提示次数 | 每轮结束从记录表汇总成一张表 |
| 行为数据 | 死亡热区、通过率、流失点统计 | 与观察笔记互证;能提示去向,说不清原因 |
| 回归 | 上轮修复清单转为下轮必看项 | 修复与验证成对出现 |
每轮收尾自检:
- 测试卡在开测前写成:假设、观察指标、决策规则齐全;
- 参与者不少于 5 人且为目标受众的陌生人(朋友占比为零,或已标注降级),每场有完整录屏与时间码笔记;
- 主持过程没有教、没有解释、没有引导(抽查录像可证);
- 48 小时内完成分诊,每条反馈有「改/不改/待观察」处置;修复清单完成并在下一轮由新玩家回归验证;
- 本轮报告落盘:看到什么、改了什么、下轮验证什么。
验收参考线在测试卡里事先定死,例如「新玩家无提示完成首个核心任务的比例」「平均卡点次数」「结束时愿意继续玩的比例」。数值因类型而异,纪律是同一条:先定线,再看分,不用事后拍脑袋。
5. 常见坑¶
- 只找朋友测:朋友的夸奖不是数据。朋友圈测试只能提出问题,不能宣布通过;里程碑验证必须换陌生人。
- 用解释代替观察:主持人忍不住教操作、讲设计意图、替游戏辩护。一解释,卡点消失,这轮测试最值钱的信息也一起消失。
- 收集一堆不处理:问卷与笔记进了抽屉,下一轮照旧。每轮必须有修复清单与回归验证,否则测试只是仪式。
- 没有假设就开测:「看看反应」的结果只剩印象与好话,支撑不了任何决策。先写测试卡(§3.1)。
- 引导性提问:「是不是太难了」问出的是礼貌,「你觉得哪里难」问出的是信息;玩家答什么就是什么,别替他写好答案。
- 在未冻结的构建上测试:边改边测,参与者玩的可能不是同一个版本,数据不可比,结论不可复用。
- 测错人群:用硬核玩家验证休闲体验,用从业者替普通玩家。招募前先对画像。
- 把玩家的方案当需求:照抄「加个自动寻路」,却不解决「迷路」本身。挖需求,不抄方案。
- 只测开头:每轮都从新手阶段开始,中期与后期从未被陌生人看过;按假设轮换测试段落,越贵的假设越先测。
- 围观氛围:一屋子人盯着屏幕,测试者表演或紧张,行为全面失真;除主持与记录外清场,远程测试只留必要人员。
延伸阅读¶
- 《制作管理手册》:§5 测试与 QA 的分层框架(自测、互测、定向外部、公开试玩),本页是其「定向外部」一档的完整展开。
- 《游戏设计手册》:验证方法与「玩具测试」的底稿,测试目标如何从设计问题里长出来。
- 《运营与增长手册》:公开试玩版、商店活动与愿望单节奏,试玩从小样本走向大样本的下一档。
- 《避坑大全》:「闭门造车」「只听身边人」类坑位的完整清单与代价等级,立项与里程碑评审时对照。
- 模板参考:测试卡、记录表与分诊清单可按本文 §3 的字段自制,一页以内为佳,够用即可。