额度有限时,优先选那些能区分不同判断的样本,而不是随机凑数或只挑最顺手的页面。一个可执行的原则是:先按“结论可能不同”分组,再从每组抽少量代表,这样一次查询能排除掉最多错误假设。但如果你的目标只是确认某个字段是否存在、或验证一条明显异常的记录,那么分层抽样反而浪费额度,直接查那一条更合理。
额度紧张时最容易犯的错,是把查询当成“多收集一点数据”。更有信息量的做法,是先写下你当前最可能采取的下一步动作,再问:哪个样本的结果会让我改变这个动作。会改变动作的样本,信息量高;无论结果如何都不影响动作的样本,信息量低。
假设你准备把一批页面按“标题需要重写”处理。此时真正有价值的样本,不是随便抽十个页面看标题,而是抽那些你判断处于临界状态的页面——比如标题长度接近你设定的阈值、或主题词位置不明确的页面。因为边界样本的结果最容易推翻你的分类规则,而典型样本往往只重复你已知的结论。
如果样本之间会导向不同处理方式,就应该分组抽取。常见的分组维度包括:页面类型、内容形态、是否已有关键词布局、以及你怀疑存在差异的来源。分组之后,每组抽一到两条,而不是按总量比例分配。
这样做的结果是:你的额度消耗对应的是“排除假设”的数量,而不是“看过页面”的数量。下一步动作应当由哪组出现意外来决定,而不是由总样本量决定。
一个明确的反例是:你怀疑某条记录本身异常,比如某个页面的收录状态与同批页面明显不同。这时分层抽样会把这条异常淹没在代表性样本里,你需要的是直接定位这一条并核对它的原始条件,而不是再从各组抽代表。
另一个失效条件是分组依据本身不可靠。如果你用来分组的字段口径不统一,比如不同来源对“已收录”的判定标准不同,那么按这个字段分组只会放大噪声,此时应先统一口径,再谈抽样。
可执行的最小动作是:写下当前判断,选出最可能推翻它的两条样本,查询后记录结果与判断是否一致。这个动作能告诉你的是“当前判断在这两条上是否成立”,不能告诉你整体比例、也不能证明某个处理一定有效。
如果两条都不一致,下一步是回到分组依据,检查是不是分类标准本身有问题;如果一条一致一条不一致,下一步是在不一致的那组追加一条,确认是普遍现象还是个别情况。额度有限时,这种“先定判断、再选样本、按结果决定是否追加”的顺序,比一次性铺开查询更能积累有效信息。