[控场AI]

#模型评估

共 6 篇相关文章

提示词扰动如何影响大模型的偏见与幻觉?
·4 分钟

提示词扰动如何影响大模型的偏见与幻觉?

一篇 arXiv 研究评估了提示词扰动对大语言模型偏见与幻觉的影响,发现扰动有时反而能缓解问题,且 Claude 3 比 GPT-3.5 表现更稳定,为可信 AI 部署提供参考。

阅读全文 →
审计LLM裁判:文本转SQL流水线中的评估失效与修复
·6 分钟

审计LLM裁判:文本转SQL流水线中的评估失效与修复

一项arXiv研究审计了生产级文本转SQL流水线中的LLM-as-judge裁判,发现gpt-4o-mini与人类一致性仅0.04,揭示GRADE-HALLUCINATION失效机制,并给出自托管Qwen模型、强裁判集成等修复方案。

阅读全文 →
事实核查分数提升的真相:证据比答案更关键
·5 分钟

事实核查分数提升的真相:证据比答案更关键

一项arXiv研究拆解了事实核查联合分数的改善来源,发现证据替换带来9.61个百分点的严格分数提升,远超答案准确率的1.96个百分点,揭示了聚合指标掩盖声明层面变化的问题。

阅读全文 →
Claude Mythos Preview基准测试成绩曝光:时间跨度超次优模型2倍
科技前沿
·5 分钟

Claude Mythos Preview基准测试成绩曝光:时间跨度超次优模型2倍

Anthropic最新模型Claude Mythos Preview在METR基准测试中表现惊人,80%成功率下时间跨度超过次优模型2倍以上,标志着AI Agent能力实现质的飞跃。本文深度解读METR评测指标及其对AI行业竞争格局的影响。

阅读全文 →
Roo Code Arena模式与Plan模式详解:AI编程助手新玩法
产品体验
·7 分钟

Roo Code Arena模式与Plan模式详解:AI编程助手新玩法

Roo Code推出Arena Mode竞技场模式和Plan Mode计划模式两大新功能。Arena模式支持AI模型盲测对决,Plan模式实现先规划后执行的编程工作流,全面提升AI辅助编程体验。

阅读全文 →
英国AISI评估报告:GPT-5.5网络安全能力与公开可用性引发治理关注
科技前沿
·8 分钟

英国AISI评估报告:GPT-5.5网络安全能力与公开可用性引发治理关注

英国AI安全研究所(AISI)发布GPT-5.5网络安全能力评估报告,结果显示其漏洞发现能力与Claude Mythos相当,但因已向公众开放使用,引发AI安全治理新挑战。本文深入解读评估发现与行业影响。

阅读全文 →