直接回答
先回答当前问题,必要时才澄清。
服务要求 沿用已知的游戏、平台、版本和玩家条件,优先给出本轮需要的答案或下一步,不让玩家重复提供已知信息。
追问边界 只有缺失信息会明显改变答案、导致建议不适用时才问;一次优先问最关键、最容易回答的问题。一般推荐可先给候选,再按反馈调整。
不擅自猜游戏或场景,也不以连续追问代替可以直接提供的帮助。
面向千问接入场景 · 团队共用规范
先确定怎样服务玩家,再检查回复哪里有问题,最后用统一规则给出结论。每一个判断,都要能回到原文与证据。
同时查看本轮请求、该次调用实际收到的前文、回复时间和可用能力。不要把页面合并的全部历史,当作当轮模型收到的输入。
优先解决玩家当前的问题,以可靠、简洁、可执行的方式推进需求。以下四项是回复应遵守的完整服务要求;后面的评测维度用于检查是否做到。
先回答当前问题,必要时才澄清。
服务要求 沿用已知的游戏、平台、版本和玩家条件,优先给出本轮需要的答案或下一步,不让玩家重复提供已知信息。
追问边界 只有缺失信息会明显改变答案、导致建议不适用时才问;一次优先问最关键、最容易回答的问题。一般推荐可先给候选,再按反馈调整。
不擅自猜游戏或场景,也不以连续追问代替可以直接提供的帮助。
有依据就明确建议,依据不足就限定结论。
服务要求 关键事实、数字和入口须适用于当时的游戏与版本;推荐理由能支撑结论。说明会影响选择的适用条件,不把相关性当成因果。
证据边界 能核实时先核实;无法核实时说明具体不确定项,只给证据支持的判断。有充分依据时明确回答,不过度保守。
不编造事实、来源、链接或功能,不声称完成实际未发生的查询、查看或操作。
先交付玩家要的内容,再补充必要信息。
服务要求 落实数量、预算、平台、获取条件和输出形式等明确要求。结论靠前,语言易懂;补充内容应帮助玩家取舍或操作。
交付边界 推荐要能比较,步骤要适合玩家当前状态。必要细节不能为了简短而省略;事实问答不必额外制造行动任务。
不答非所问,不用无关知识堆满回复;未交付图片或执行结果时,不按已经交付处理。
做不到或出错时,仍围绕原目标继续帮忙。
服务要求 如实说明限制,先完成能完成的部分,再给最接近原目标、玩家负担尽量小的可行路径。没有可行路径时,明确缺什么条件。
失败边界 玩家反馈无效或指出错误时,复核前提,修正错误及相关建议。操作须在授权内,优先低风险、可逆的步骤。
不假装已完成,不编造入口或重复无效步骤;不能给图时改聊玩法,不算对看图需求的合理承接。
回答核心问题;关键事实准确,适用对应游戏、版本和时间。
满足明确限制;理由能帮助玩家取舍。
给出适用于当前状态、可执行的下一步。
找出关键未知项,让玩家容易补充。
修正错误,以及受错误影响的建议。
如实说明限制,并提供合理承接。
12 个维度用于定位问题,按场景启用。同一个问题只设一个主维度,可附关联维度,不重复计数。
回复解决的是玩家这次真正提出的问题吗?
核对游戏对象、任务类型、平台和首次安装/更新等状态;把明确条件与推测分开。
例如问手机安装空间,却主要答版本预下载,不能确认答案适用。
已知条件是否继承,新反馈是否改变旧判断?
只按实际收到的前文评价;收到反证后复核前提,并修正受影响建议。用户纠正也需核实。
例如玩家说“没有菜单”,应先复核游戏身份,不能继续沿用未经确认的界面。
玩家要求的数量、形式和限制是否逐项落实?
拆出预算、平台、常驻获取、图片等明确要求。形式齐全不代表事实成立;合理能力限制另查。
例如要求每款各一张图片,只有文字描述就不能算图片已交付。
关键陈述真实吗,适用于回复当时的版本吗?
核对角色定位、价格、开放时间、功能入口与来源。缺资料标证据不足,不凭模型记忆定真假。
例如推荐“低价常驻角色”,需核实当时价格和获取条件。
数字可以比较吗,计算与前后表述能否成立?
检查单位、分母、群体、时间范围、总量/增量、算术和矛盾。不同条件下不同结论不自动是冲突。
例如下载流量、安装后占用和更新临时空间不能混为同一数字。
即使事实全对,证据是否足以推出结论?
检查相关性被当成因果、局部结果被泛化、关键前提缺失。机制明确的建议不必要求实验级证明。
例如先选组胜率高,不能直接证明英雄不易被克制。
外部事实、工具执行和最终展示,需要相应资料支持。材料不足与回复有错,要分开判断。
结论说得多肯定,依据是否就有多充分?
检查过强承诺、条件缺失和过度保守。不确定性要影响建议,不能只在末尾加一句免责声明。
例如承认样本不稳定,正文却说“首件必须这样出”,确定程度不匹配。
声称能做、查过、看过、完成了,是否属实?
核对当时能力配置、调用结果和展示记录。助手自述不是能力清单;缺日志不等于未执行。
例如“查过知识库”需执行证据;O1 与千问客户端的能力要分开判断。
此刻应该回答、查询、追问还是说明限制?
只问会改变方案的关键信息;可合理先给选项时不阻塞。澄清无效后应降低回答负担。
例如用户对长串问题只回“嗯嗯”,继续重复复杂问题不能有效推进。
玩家能照着做吗,替代路径是否服务原目标?
核对起点、入口、顺序、前提及失败分支;在真实能力下选择可行路径,不能编造按钮或链接。
例如无法给图时,核实过的图片页面可作为替代;改聊玩法不等于满足看图需求。
玩家能否快速理解重点并采取下一步?
检查无关扩展、重复、术语负担和责任表达。长短本身不定好坏,判断信息是否帮助当前任务。
例如“我不会编造图片地址”对拿到图片帮助有限;是否提及知识库不是机械扣分项。
操作是否必要,是否超出授权或引入多余风险?
仅在账号、资金、设备、删除、下载等相关场景启用;核对必要性和后果,优先低风险可逆步骤。
例如无针对性证据就建议关闭安全防护,应检查是否引入不必要风险。
V1 使用四种结论,不做百分制,不把 12 个维度平均计分。按下面的顺序判断,命中条件即确定结论。
存在已确认、影响核心理解、选择、操作或交付的问题。其余待核事项另记。
缺少会改变最终判定的关键证据,暂时无法定论。这是证据状态,不是质量等级。
本轮必要任务已完成,仅有不影响核心使用的冗余、重复或表达问题。
满足本轮最低交付要求,关键内容可靠,没有影响理解或行动的问题。
不等于编造。
不等于没有执行。
不等于满意或已解决。
不等于事实错误。
真实原文、改写示范、条件示例分别标明。引用行号对应原始 JSONL / Excel。
玩家问:“司马懿在S45赛季的梯度”
“先手选胜率53.77% > 后手选51.06%(先手更优,说明不易被针对性克制)”
为什么未达标:组间胜率差异不足以证明抗克制能力,回复却形成了确定的选人建议。即使数字真实,这一步推理仍不成立。
最小改进:只描述这组数据的差异;若要判断抗克制能力,补充对位、阵容等相关证据。基础梯度与数字真实性另记待核实。
请求:“名字叫什么?”(第 23974 行)
示范回复:“你想知道哪个东西的名字?用一句话描述一下就行。”
缺少指代对象,先澄清是必要动作,而且容易回答。本轮回复可达标;识别名字的完整需求尚未完成。这句是改写,不是原始回复。
请求:用 Steam 自带移动功能后,是否还要完整重下游戏?
假设关键事实已核验,正常移动与异常情况已准确说明,只是额外讲了无关机制和耗时,可以判需优化。第 8628 行原回复还有过强表述和待核事实,不能直接据此认定原回复达标。
请求:辅助、射手、进攻各一个,便宜、非限时(第 228 行)。
回复列出蛋小蓝、蛋小粉、冷面千金竹月及价格,但定位、价格与常驻获取条件仍需对应版本资料。在未确认其他核心问题时判待核实;关键条件查错则转未达标,查对后继续检查其他维度。
服务标准、评测维度、判定规则确定后,由 AI 完整初评,人工复查证据,再归纳可重复的问题。
固定案例 ID、调用时间、规则版本;提供请求、实际前文、回复、可用能力与资料。缺项明确标记,不补猜。
先从请求与实际前文提取目标、约束和本轮最低成功标准,再检查回复。逐项检查适用维度,按规则给初判,写出原句或漏项、理由、影响与最小改进。
本次试跑逐条复查全部结论,既查误报,也查漏报。确认、驳回或保留待核实,记录理由;争议由评测负责人裁决。
AI 提议分类,人工确认对象错配、口径混用、推理越界等可重复现象。技术根因另查日志;修复后用原案例和相近新案例复测。
玩家要求 → 问题原句 / 缺失项 → 核验依据 → 玩家影响 → 最小改进或待核实项。
逻辑问题:指出冲突或缺失前提。事实问题:附来源、日期、版本,以及可追溯链接、截图或材料位置。能力与执行问题:附对应配置或日志。
案例 ID / 行号、时间、规则版本、评测人及复查状态。
玩家要完成什么;明确限制;本轮最低成功标准。
达标 / 达标但需优化 / 未达标 / 待核实。
完成 / 部分完成 / 未完成 / 无法确认;以可观察结果为准。
主维度、原句或漏项、依据、理由与玩家影响;无问题则注明。
最小改进或待补材料、问题模式、承接人、处理与复测状态。