大语言模型高质量数据集汇总(2025.8 更新)
注意:SFT数据集尤其是比较老的数据集质量其实低下,用 DeepSeek 等top模型重新回答下提问效果可能更好。
预训练数据集
数据处理工具:
SFT 数据集
偏好数据集
推理数据集
评测数据集
根据 DeepSeek V3、Qwen3 等最新模型的评测数据集调整而来,选取最新、最流行、最具有代表性的评测数据集。
| 评测数据集 |
类型 |
大小 |
语言 |
特点 |
| LiveBench |
综合(偏数学和代码) |
|
英 |
定时更新的综合评测集,质量较高 |
| AlignBench v1.1 |
多轮对话 |
683 |
中 |
中文对齐评测集,需要LLM作为裁判 |
| IFEval |
指令遵循 |
|
英 |
自动打分 |
| 大海捞针 |
长上下文 |
|
英 |
通过插入针的方法评测长上下文能力 |
| Arena-Hard |
多轮对话 |
|
英 |
Arena 中比较难的问题,需要 LLM 作为裁判 |
| BFCL v3 |
函数调用 |
|
英 |
比较全面的函数调用评测集 |
| MMLU-Redux |
综合(世界知识) |
|
英 |
MMLU的增强版本 |
| GPQA-Diamond |
综合(世界知识、复杂推理) |
|
英 |
GPQA 中比较难的问题(博士级别) |
| AIME’24 |
数学推理 |
|
英 |
2024年的AIME数据集 |
| LiveCodeBench v5 |
代码生成 |
|
英 |
定时更新的代码生成评测集 |
| C-Eval |
综合(世界知识) |
|
中 |
中文场景下的综合评测集,目前模型多过拟合。 |
| CMMLU |
综合(世界知识) |
|
中 |
中文场景下的综合评测集,目前模型多过拟合。 |
| MATH-500 |
数学推理 |
|
英 |
OpenAI 的MATH数据集 |
| AIME’25 |
数学推理 |
|
英 |
2025年的AIME数据 |
| RULER |
长上下文 |
|
英 |
评测模型上上下文的能力 |
大语言模型高质量数据集汇总(2025.8 更新)
预训练数据集
数据处理工具:
SFT 数据集
偏好数据集
推理数据集
评测数据集