https://modelscope.cn/datasets/opencompass/AIME2025,此数据集包含来自2025年美国数学邀请赛(AIME)I卷和II卷的问题。
https://modelscope.cn/datasets/modelscope/gpqa,由生物学、物理学和化学领域的专家编写并验证的多选问答数据集。
https://huggingface.co/livecodebench,从三个编程竞赛平台收集问题,分别是 LeetCode、AtCoder 和 CodeForces。
https://paperswithcode.com/dataset/arena-hard,通过 Chatbot Arena 收集的 200,000 个用户查询的数据集中的实时数据构建而成。
https://huggingface.co/datasets/cais/mmlu,Massive Multitask Language Understanding,MMLU 涵盖 57 个学科,涵盖 STEM、人文科学和社会科学,从基础到专业水平。
https://huggingface.co/datasets/haonan-li/cmmlu,中文版MMLU,涵盖了从基础学科到高级专业水平的67个主题。
https://paperswithcode.com/dataset/arc-agi,Abstraction and Reasoning Corpus - Artificial General Intelligence,用于衡量 AI 系统泛化能力和解决新颖任务能力的基准测试,更注重考察 AI 的抽象推理能力。
哈佛大学-麻省理工学院数学竞赛(HMMT)2025 年相关数学推理问题,用于评估模型的数学推理能力。