决策模型架构
让 LLM 做判断的常见做法是把规则写进 prompt 里让它输出 JSON——易被诱导、解析不稳、token 开销大。U2 Decision 的做法是构建专用决策模型:不生成文本,直接读取候选答案的 logit 输出概率分布,判定标准以结构化 criteria 传入,返回即可被代码直接消费的类型化答案。
1.LLM Logit Readout:跳过自回归解码,直接读取候选 token 的 logit,对选项逐一打分并归一化为概率,单 token 完成一次判定,接口兼容 Jev-compatible 协议;
2.Encoder + Decision Head:面向分类、评分等标准判定任务,主干编码器配合决策头直接输出 P(choice|x),毫秒级返回;
3.LLM Decision Fine-tuning:在通用 LLM 基座之上做决策专项微调,把判定能力注入模型内部;
4.RLCD 校准训练:以 ECE / Brier Score 为目标优化置信度质量,让模型知道自己拿不准,为自动执行与转人工分流提供依据。
依托这套架构,U2 Decision 一次调用即可并行判定多个类型化问题(Choice / Score / 概率),答案按问题 ID 原样返回 choice、probabilities、confidence 三个字段,Agent 与工作流可直接分支、排序、路由,token 开销远低于让对话模型顺手判一下。



