覆盖全球主流大语言模型,基于多维度标准化评测。关注开/关思考能力差异,揭示模型真实水平。
核心创新:同时评测模型在开启和关闭链式思考(CoT)时的表现差异,揭示模型的真实基座能力与思维链依赖程度。
覆盖数学推理、逻辑判断、代码生成、语言理解四大维度,每维度独立评分,综合加权计算总分。
记录各模型的运行硬件环境(如华为昇腾、英伟达等),分析硬件依赖对模型能力的影响。