Artificial Analysis / 自定义模型权重决策中心 v4.3 动态架构

包含 18 款前沿模型(已添加 Qwen3.8 Max),基于官方底座跑分。自由调配 10 大 Benchmark 权重、一键剔除单项,实时生成专属排行榜。

权重与基准指标偏好调节

拖动滑块、点击 ± 或按键盘 ← / → 微调 1% · 各项始终常显官方基准值 · 支持单项或全局一键重置
业务偏好预设:

模型综合能力指数 (Intelligence Evaluations)

柱高及刻度轴随分值自适应动态扩展 · 仅在名次变动时显示升降标签
有效权重加总:100%

18 款模型明细对比矩阵 (全 10 项评测底座 · 支持点击表头排序)

点击任意列标题即可对该单项进行升序(▲)/ 降序(▼)重排
当前排名 模型名称 厂商 你的综合得分 官方默认得分 名次变动 Terminal-4.0 (10%) SciCode (10%) Briefcase (15%) GDPval v2 (10%) Automation (5%) Omniscience (15%) GDP.pdf (10%) AA-LCR (5%) HLE (10%) CritPt (10%)