HealthBench是由OpenAI发布的医疗领域人工智能基准测试,旨在系统评估AI模型在医疗健康场景中的问答、诊断建议和临床推理等能力。该基准覆盖多类医学专业场景,采用严格的评分机制以衡量模型输出的准确性与安全性,为医疗AI系统的研究与比较提供标准化评测框架。
此前的HealthBench健康基准测试存在被游戏化的问题:模型给出的答案越长,得分就越高
OpenAI通过引入「长度税」(length tax)来惩罚过长的回答,修复了HealthBench的刷分问题
GPT 5.5在承受长度税额外惩罚的情况下仍然取得了更高的HealthBench分数
各大AI实验室发现HealthBench的冗长加成漏洞后,纷纷利用这种机制来刷分