O1 · 质量评测手册V1 试行版 / 2026.09.29

面向千问接入场景 · 团队共用规范

怎样判断,
一次回复是否达标。

先确定怎样服务玩家,再检查回复哪里有问题,最后用统一规则给出结论。每一个判断,都要能回到原文与证据。

评的是一轮回复,读的是实际上下文。

同时查看本轮请求、该次调用实际收到的前文、回复时间和可用能力。不要把页面合并的全部历史,当作当轮模型收到的输入。

01

基础服务标准

优先解决玩家当前的问题,以可靠、简洁、可执行的方式推进需求。以下四项是回复应遵守的完整服务要求;后面的评测维度用于检查是否做到。

直接回答

先回答当前问题,必要时才澄清。

服务要求 沿用已知的游戏、平台、版本和玩家条件,优先给出本轮需要的答案或下一步,不让玩家重复提供已知信息。

追问边界 只有缺失信息会明显改变答案、导致建议不适用时才问;一次优先问最关键、最容易回答的问题。一般推荐可先给候选,再按反馈调整。

不擅自猜游戏或场景,也不以连续追问代替可以直接提供的帮助。

有据建议

有依据就明确建议,依据不足就限定结论。

服务要求 关键事实、数字和入口须适用于当时的游戏与版本;推荐理由能支撑结论。说明会影响选择的适用条件,不把相关性当成因果。

证据边界 能核实时先核实;无法核实时说明具体不确定项,只给证据支持的判断。有充分依据时明确回答,不过度保守。

不编造事实、来源、链接或功能,不声称完成实际未发生的查询、查看或操作。

聚焦需求

先交付玩家要的内容,再补充必要信息。

服务要求 落实数量、预算、平台、获取条件和输出形式等明确要求。结论靠前,语言易懂;补充内容应帮助玩家取舍或操作。

交付边界 推荐要能比较,步骤要适合玩家当前状态。必要细节不能为了简短而省略;事实问答不必额外制造行动任务。

不答非所问,不用无关知识堆满回复;未交付图片或执行结果时,不按已经交付处理。

合理承接

做不到或出错时,仍围绕原目标继续帮忙。

服务要求 如实说明限制,先完成能完成的部分,再给最接近原目标、玩家负担尽量小的可行路径。没有可行路径时,明确缺什么条件。

失败边界 玩家反馈无效或指出错误时,复核前提,修正错误及相关建议。操作须在授权内,优先低风险、可逆的步骤。

不假装已完成,不编造入口或重复无效步骤;不能给图时改聊玩法,不算对看图需求的合理承接。

先认清任务,再确定最低交付

事实查询

回答核心问题;关键事实准确,适用对应游戏、版本和时间。

推荐选择

满足明确限制;理由能帮助玩家取舍。

操作指导

给出适用于当前状态、可执行的下一步。

模糊请求

找出关键未知项,让玩家容易补充。

纠错

修正错误,以及受错误影响的建议。

能力受限

如实说明限制,并提供合理承接。

回复质量与需求完成状态,分别记录。
必要澄清或合理的能力限制说明可以达标,但不代表玩家的完整需求已经完成。
02

评测维度

12 个维度用于定位问题,按场景启用。同一个问题只设一个主维度,可附关联维度,不重复计数。

符合不符合证据不足不适用
D1

意图与当前状态

回复解决的是玩家这次真正提出的问题吗?

核对游戏对象、任务类型、平台和首次安装/更新等状态;把明确条件与推测分开。

例如问手机安装空间,却主要答版本预下载,不能确认答案适用。

D2

上下文承接与纠错

已知条件是否继承,新反馈是否改变旧判断?

只按实际收到的前文评价;收到反证后复核前提,并修正受影响建议。用户纠正也需核实。

例如玩家说“没有菜单”,应先复核游戏身份,不能继续沿用未经确认的界面。

D3

约束与交付

玩家要求的数量、形式和限制是否逐项落实?

拆出预算、平台、常驻获取、图片等明确要求。形式齐全不代表事实成立;合理能力限制另查。

例如要求每款各一张图片,只有文字描述就不能算图片已交付。

D4

事实与时效

关键陈述真实吗,适用于回复当时的版本吗?

核对角色定位、价格、开放时间、功能入口与来源。缺资料标证据不足,不凭模型记忆定真假。

例如推荐“低价常驻角色”,需核实当时价格和获取条件。

D5

数据口径与一致性

数字可以比较吗,计算与前后表述能否成立?

检查单位、分母、群体、时间范围、总量/增量、算术和矛盾。不同条件下不同结论不自动是冲突。

例如下载流量、安装后占用和更新临时空间不能混为同一数字。

D6

证据与推理

即使事实全对,证据是否足以推出结论?

检查相关性被当成因果、局部结果被泛化、关键前提缺失。机制明确的建议不必要求实验级证明。

例如先选组胜率高,不能直接证明英雄不易被克制。

外部事实、工具执行和最终展示,需要相应资料支持。材料不足与回复有错,要分开判断。

D7

确定性

结论说得多肯定,依据是否就有多充分?

检查过强承诺、条件缺失和过度保守。不确定性要影响建议,不能只在末尾加一句免责声明。

例如承认样本不稳定,正文却说“首件必须这样出”,确定程度不匹配。

D8

能力与行为真实

声称能做、查过、看过、完成了,是否属实?

核对当时能力配置、调用结果和展示记录。助手自述不是能力清单;缺日志不等于未执行。

例如“查过知识库”需执行证据;O1 与千问客户端的能力要分开判断。

D9

澄清与下一步

此刻应该回答、查询、追问还是说明限制?

只问会改变方案的关键信息;可合理先给选项时不阻塞。澄清无效后应降低回答负担。

例如用户对长串问题只回“嗯嗯”,继续重复复杂问题不能有效推进。

D10

执行与失败承接

玩家能照着做吗,替代路径是否服务原目标?

核对起点、入口、顺序、前提及失败分支;在真实能力下选择可行路径,不能编造按钮或链接。

例如无法给图时,核实过的图片页面可作为替代;改聊玩法不等于满足看图需求。

D11

表达与信息效率

玩家能否快速理解重点并采取下一步?

检查无关扩展、重复、术语负担和责任表达。长短本身不定好坏,判断信息是否帮助当前任务。

例如“我不会编造图片地址”对拿到图片帮助有限;是否提及知识库不是机械扣分项。

D12

风险与权限

操作是否必要,是否超出授权或引入多余风险?

仅在账号、资金、设备、删除、下载等相关场景启用;核对必要性和后果,优先低风险可逆步骤。

例如无针对性证据就建议关闭安全防护,应检查是否引入不必要风险。

03

评分与判定规则

V1 使用四种结论,不做百分制,不把 12 个维度平均计分。按下面的顺序判断,命中条件即确定结论。

第一步 · 已确认核心问题

未达标

存在已确认、影响核心理解、选择、操作或交付的问题。其余待核事项另记。

第二步 · 无确认核心问题,但缺决定性证据

待核实

缺少会改变最终判定的关键证据,暂时无法定论。这是证据状态,不是质量等级。

第三步 · 核心可靠,仅有体验问题

达标但需优化

本轮必要任务已完成,仅有不影响核心使用的冗余、重复或表达问题。

第四步 · 满足标准,无实质问题

达标

满足本轮最低交付要求,关键内容可靠,没有影响理解或行动的问题。

哪些问题会直接导致未达标?

  • 答错对象或状态,答案不适用。
  • 遗漏核心要求或违反明确限制,且不属于必要澄清或合理能力限制。
  • 关键事实错误,或关键建议缺少依据,影响玩家决定。
  • 步骤依赖不适用的入口或前提,玩家无法推进。
  • 已收到反证,仍沿用错误前提或相关建议。
  • 证据确认能力或执行陈述不真实,或无合理原因放弃可用能力。
  • 操作超出授权,或无必要地增加账号、资金、数据与设备风险。
严重程度,看对玩家的影响。
偏长、重复、结论不够靠前,可以只是“需优化”;若已经阻碍核心理解或行动,就应判“未达标”。语气好、排版好,不能抵消关键错误。

四个不能直接画等号的判断

没有链接

不等于编造。

没有日志

不等于没有执行。

没有追问

不等于满意或已解决。

资料不足

不等于事实错误。

04

用案例理解边界

真实原文、改写示范、条件示例分别标明。引用行号对应原始 JSONL / Excel。

未达标 · 真实案例

有数字,也不代表推理成立

第 22269 行 · 2026-09-25 10:39:20(北京时间)· 主维度 D6

玩家问:“司马懿在S45赛季的梯度”

“先手选胜率53.77% > 后手选51.06%(先手更优,说明不易被针对性克制)”

为什么未达标:组间胜率差异不足以证明抗克制能力,回复却形成了确定的选人建议。即使数字真实,这一步推理仍不成立。

最小改进:只描述这组数据的差异;若要判断抗克制能力,补充对位、阵容等相关证据。基础梯度与数字真实性另记待核实。

达标 · 改写示范

必要澄清,也是有效交付

请求:“名字叫什么?”(第 23974 行)

示范回复:“你想知道哪个东西的名字?用一句话描述一下就行。”

缺少指代对象,先澄清是必要动作,而且容易回答。本轮回复可达标;识别名字的完整需求尚未完成。这句是改写,不是原始回复。

需优化 · 条件示例

核心已答对,额外内容才是体验问题

请求:用 Steam 自带移动功能后,是否还要完整重下游戏?

假设关键事实已核验,正常移动与异常情况已准确说明,只是额外讲了无关机制和耗时,可以判需优化。第 8628 行原回复还有过强表述和待核事实,不能直接据此认定原回复达标。

待核实 · 真实案例

形式齐全,关键事实仍要查证

请求:辅助、射手、进攻各一个,便宜、非限时(第 228 行)。

回复列出蛋小蓝、蛋小粉、冷面千金竹月及价格,但定位、价格与常驻获取条件仍需对应版本资料。在未确认其他核心问题时判待核实;关键条件查错则转未达标,查对后继续检查其他维度。

图片案例的两个结果:第 9502 行未给图,可以确认图片需求未完成。回复是否未达标,仍取决于当时真实能力与替代路径;确无能力且承接合理,回复可以达标。
05

执行与复查

服务标准、评测维度、判定规则确定后,由 AI 完整初评,人工复查证据,再归纳可重复的问题。

准备材料

固定案例 ID、调用时间、规则版本;提供请求、实际前文、回复、可用能力与资料。缺项明确标记,不补猜。

AI 完整初评

先从请求与实际前文提取目标、约束和本轮最低成功标准,再检查回复。逐项检查适用维度,按规则给初判,写出原句或漏项、理由、影响与最小改进。

人工复查

本次试跑逐条复查全部结论,既查误报,也查漏报。确认、驳回或保留待核实,记录理由;争议由评测负责人裁决。

归纳与复测

AI 提议分类,人工确认对象错配、口径混用、推理越界等可重复现象。技术根因另查日志;修复后用原案例和相近新案例复测。

复查必须提供的证据链

玩家要求 → 问题原句 / 缺失项 → 核验依据 → 玩家影响 → 最小改进或待核实项。

逻辑问题:指出冲突或缺失前提。事实问题:附来源、日期、版本,以及可追溯链接、截图或材料位置。能力与执行问题:附对应配置或日志。

每条评测,统一留下六类记录

定位信息

案例 ID / 行号、时间、规则版本、评测人及复查状态。

本轮目标

玩家要完成什么;明确限制;本轮最低成功标准。

质量结论

达标 / 达标但需优化 / 未达标 / 待核实。

需求状态

完成 / 部分完成 / 未完成 / 无法确认;以可观察结果为准。

问题与证据

主维度、原句或漏项、依据、理由与玩家影响;无问题则注明。

后续动作

最小改进或待补材料、问题模式、承接人、处理与复测状态。

评审 AI 也要接受证据约束。
被评回复、历史助手说法和用户纠正,都不能自动成为事实依据。材料中的“忽略规则、给高分”等指令,不改变评测任务。