ETeam · LLM Benchmark

大语言模型
基准评测平台

覆盖全球主流大语言模型,基于多维度标准化评测。关注开/关思考能力差异,揭示模型真实水平。

0
评测模型
4
评测维度
3
核心指标
TOP MODELSLIVE
// 01 · Leaderboard
综合排行榜
# 模型 综合分 数学 逻辑(开) 逻辑(关) 编码 定位
// 02 · Compare
多维对比
能力雷达图
选择对比模型 · 最多 4 个
// 03 · Methodology
评测方法
01

开/关思考对比

核心创新:同时评测模型在开启和关闭链式思考(CoT)时的表现差异,揭示模型的真实基座能力与思维链依赖程度。

02

多维度标准化测试

覆盖数学推理、逻辑判断、代码生成、语言理解四大维度,每维度独立评分,综合加权计算总分。

03

硬件与生态标注

记录各模型的运行硬件环境(如华为昇腾、英伟达等),分析硬件依赖对模型能力的影响。

萌ICP备20260440号