Unverified50% confidenceFactExact time
Arize Phoenix专注于LLM评估,通过内置评估模板对检索相关性、回答忠实度和幻觉率进行量化打分
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/21/2026
First Seen
Valid until: 10/19/2026
Sources
Related Claims
UnverifiedArize Phoenix偏向ML Ops传统,提供embedding漂移检测、检索质量评估(如NDCG、MRR)和LLM-as-judge自动评估框架78% similarUnverified智能体评估的主流方案包括LLM-as-Judge、轨迹匹配和结果验证69% similarUnverifiedArize提供基于嵌入向量(Embedding)的漂移检测能力,通过追踪向量分布捕捉语义层面的分布变化66% similarUnverified对于难以自动化评估的指标(如幻觉率),部分团队引入LLM-as-Judge方法进行辅助评分66% similarUnverified深度研究智能体的评估可参考RAGAS框架,从忠实度、答案相关性等多维度评测65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/579660API
curl https://kongchang.com/api/v1/knowledge/claims/579660MCP
get_claim(id=579660)