[KongchangAI]
ConceptCriticGen框架

CriticGen

一种细粒度、生成感知的LLM评估框架,通过动态生成样本级评分维度和评分标准,将评估结果直接转化为可执行的改进反馈

Timeline (last 90 days)

Sep 11

论文核心观点认为细粒度评估必须同时具备实例特异性(instance-specific)和可执行性(actionable)

Unverified50%
Sep 11

CriticGen以动态评分表为条件,联合产出分数、理由、可执行的改进建议和改进后的答案四项内容

Unverified50%
Sep 11

CriticGen的动态评分标准组织在主观约束、客观约束、自推导约束三个高层类别之下

Unverified50%
Sep 11

CriticGen生成的评分表相关性和覆盖度分别从3.33/4.03提升到3.97/4.24

Unverified50%
Sep 11

CriticGen的评分与人类判断的Pearson相关系数为0.9556,Spearman相关系数为0.9560

Unverified50%
Sep 11

CriticGen是一个细粒度、生成感知(generation-aware)的评估框架,为每个样本生成专属的评估维度和评分标准,并联合产出分数、理由、可执行的改进建议和改进后的答案

Unverified50%
Sep 11

实验显示CriticGen改善了73.17%的答案,并保持了93.28%的非退化率

Unverified50%
Sep 11

CriticGen产生的结构化反馈可用于在DPO或KTO等对齐训练方法中自动生成偏好对,将原始答案作为被拒绝样本、修改后答案作为被选择样本

Unverified50%
Sep 11

自我修正领域涌现了CRITIC、Self-Refine、Reflexion等方法,CriticGen可视为这一技术脉络的最新进展

Unverified50%
Sep 11

CriticGen在基于标准的理由和可执行建议上的F1分数分别从0.6369/0.5994提升到0.7554/0.7900

Unverified50%

1 more timeline events

All Facts (11)

Source Articles