跳到正文
原文
arXiv: LLM marketing / consumer· Danial Amin·· 14 天前AI 评分12

别信榜单:通用 LLM 排名的局限与任务专属评估的必要性

Do Not Trust the Benchmark: Limitations of General LLM Rankings and a Case for Task-Specific Evaluation

AI 导读

一篇 arXiv 观点文章指出,通用 LLM 排名存在五类相互关联的局限:被评测系统与公开可用系统不一致、外部评测中的商业激励与依赖、基准饱和与测试缺陷及数据污染、模型钻评分规则空子,以及通用分数与用户实际任务相关性有限。

来源:arXiv: LLM marketing / consumer · arxiv.org