AIME2025

https://modelscope.cn/datasets/opencompass/AIME2025,此数据集包含来自2025年美国数学邀请赛(AIME)I卷和II卷的问题。

GPQA

https://modelscope.cn/datasets/modelscope/gpqa,由生物学、物理学和化学领域的专家编写并验证的多选问答数据集。

LiveCodeBench

https://huggingface.co/livecodebench,从三个编程竞赛平台收集问题,分别是 LeetCode、AtCoder 和 CodeForces。

Arena-hard

https://paperswithcode.com/dataset/arena-hard,通过 Chatbot Arena 收集的 200,000 个用户查询的数据集中的实时数据构建而成。

BFCL-v3

https://gorilla.cs.berkeley.edu/blogs/13_bfcl_v3_multi_turn.html,由加州大学伯克利分校的研究人员开发的,旨在帮助研究人员和开发者了解不同函数调用实现的性能表现。

MMLU

https://huggingface.co/datasets/cais/mmlu,Massive Multitask Language Understanding,MMLU 涵盖 57 个学科,涵盖 STEM、人文科学和社会科学,从基础到专业水平。

CMMLU

https://huggingface.co/datasets/haonan-li/cmmlu,中文版MMLU,涵盖了从基础学科到高级专业水平的67个主题。

ARC-AGI

https://paperswithcode.com/dataset/arc-agi,Abstraction and Reasoning Corpus - Artificial General Intelligence,用于衡量 AI 系统泛化能力和解决新颖任务能力的基准测试,更注重考察 AI 的抽象推理能力。

HMMT25

哈佛大学-麻省理工学院数学竞赛(HMMT)2025 年相关数学推理问题,用于评估模型的数学推理能力。