结论是:额度有限时,不要按词表顺序平均取样,而应按“分歧来源”分层取样——先取能区分不同解释的样本,再取能覆盖主要业务分组的样本。这样做的代价是样本不再代表词表整体,所以只适合用来判断分歧点,不适合直接推算全量结果。如果团队成员对“同一事实”的理解其实源于不同的匹配方式或不同的查询对象,那么分层取样会失效,必须先统一查询口径。
多个角色对同一批关键词的查询结果有不同理解时,分歧通常落在三处:查询对象的范围不同、匹配方式的设定不同、对结果字段的解读不同。这三类分歧需要的样本并不一样。范围分歧要靠边界样本,匹配分歧要靠对照样本,解读分歧要靠重复样本。若不加区分就随机抽样,很可能抽到的全是大家本来就一致的部分,额度花掉了,分歧仍在。
一个可操作的动作是:让每位参与者各写一句“我认为这个结果应该是什么样”,把句子并排放在一起。凡是两句话指向不同字段或不同范围的,就是需要抽样的分歧点。这样做的结果会直接改变下一步——你不再需要覆盖整个词表,只需要覆盖这些分歧点。
假设词表有若干业务分组,额度只够查其中一部分。可以按下面的顺序分配:
每层的最小样本数不必大,但每层都要有。这样做的结果是:如果各层结果方向一致,可以较早停止追加查询;如果某一层明显偏离,下一步就应把额度集中到那一层,而不是平均追加。
够用的信号是:新增样本落在已有结论的范围内,没有出现新的分歧类型。不够用的信号是:每查一批就冒出一类此前没见过的差异。后者通常说明查询对象或匹配口径还没统一,此时继续加样本只会放大混乱。
需要提醒的是,某一层查询结果为空或数量很少,并不能单独证明该层不重要。空结果还可能来自查询对象写错、匹配方式过严、或者该分组本身在词表中就很少。要把这几种解释分开,至少需要再取一个同层的对照样本,看它是否也为空。
假设某团队有 500 个待查词,额度只够查 40 个,成员对“哪些词值得保留”意见不一。按顺序取前 40 个,可能全部落在同一个业务分组,结论无法外推。改为按分组各取 5 个、再取 10 个争议词,得到的结果会显示:某些分组内部高度一致,争议主要集中在少数词上。此时下一步动作是把讨论范围缩小到那少数词,而不是继续追加查询。这个例子只说明取样结构如何影响结论,不代表任何具体工具的额度或返回规模,实际额度与返回字段需要以所用工具的当前说明为准。
如果分歧的根源不是样本选择,而是各方对“查询对象”本身就没有共识——比如有人按词根理解,有人按完整短语理解——那么再精细的分层也只会得到互相不可比的结果。此时应先固定一份查询对象清单,让所有人基于同一份清单描述预期,再开始取样。另一个失效条件是:额度少到连每层一个样本都无法覆盖,这时更合理的做法是先缩小词表范围,而不是硬凑样本。