#模型评估
共 6 篇相关文章

·4 分钟
提示词扰动如何影响大模型的偏见与幻觉?
一篇 arXiv 研究评估了提示词扰动对大语言模型偏见与幻觉的影响,发现扰动有时反而能缓解问题,且 Claude 3 比 GPT-3.5 表现更稳定,为可信 AI 部署提供参考。
阅读全文 →

·6 分钟
审计LLM裁判:文本转SQL流水线中的评估失效与修复
一项arXiv研究审计了生产级文本转SQL流水线中的LLM-as-judge裁判,发现gpt-4o-mini与人类一致性仅0.04,揭示GRADE-HALLUCINATION失效机制,并给出自托管Qwen模型、强裁判集成等修复方案。
阅读全文 →

·5 分钟
事实核查分数提升的真相:证据比答案更关键
一项arXiv研究拆解了事实核查联合分数的改善来源,发现证据替换带来9.61个百分点的严格分数提升,远超答案准确率的1.96个百分点,揭示了聚合指标掩盖声明层面变化的问题。
阅读全文 →
科技前沿·5 分钟
Claude Mythos Preview基准测试成绩曝光:时间跨度超次优模型2倍
Anthropic最新模型Claude Mythos Preview在METR基准测试中表现惊人,80%成功率下时间跨度超过次优模型2倍以上,标志着AI Agent能力实现质的飞跃。本文深度解读METR评测指标及其对AI行业竞争格局的影响。
阅读全文 →
产品体验·7 分钟
Roo Code Arena模式与Plan模式详解:AI编程助手新玩法
Roo Code推出Arena Mode竞技场模式和Plan Mode计划模式两大新功能。Arena模式支持AI模型盲测对决,Plan模式实现先规划后执行的编程工作流,全面提升AI辅助编程体验。
阅读全文 →
科技前沿·8 分钟
英国AISI评估报告:GPT-5.5网络安全能力与公开可用性引发治理关注
英国AI安全研究所(AISI)发布GPT-5.5网络安全能力评估报告,结果显示其漏洞发现能力与Claude Mythos相当,但因已向公众开放使用,引发AI安全治理新挑战。本文深入解读评估发现与行业影响。
阅读全文 →