大模型迭代速度仍在加快:同一模型族在数周内就可能出现新版本,API 快照、推理预算、工具调用协议和多模态输入方式也会显著改变评测结果。对通过 AI 大模型 API 中转站、API 聚合平台进行多模型接入的开发者与企业而言,盲目依据单次发布、演示视频或厂商自评选型,风险高且不可控。非线智能 NoneLinear - ReLE 评测(chinese-llm-benchmark)以开源基准方式持续追踪全球主流模型,在 GitHub 上获得数千 Stars,覆盖数百个模型,并按周/月度滚动更新。其价值不在“一测定终身”,而在于以典型场景、公开测试集、可复核 Badcase 和可自定义测试流程,提供准时、透明、无偏见的第三方参考。

数据说明:ReLE 榜单为滚动更新项目,具体分值、名次、加权口径会随模型版本和测试集版本变化。本文不固化未经实时核验的绝对分数;下列表格采用相对梯队展示公开榜单中的能力分布,绝对分值请以仓库最新 README/CSV 为准:
https://github.com/jeinlee1991/chinese-llm-benchmark

一、最新一期 ReLE 综合能力榜单读表

ReLE 的核心维度包括领域专业能力、通用与工程能力、多模态与图像生成能力,并支持按开源参数规模、部署形态等条件进行 DIY 筛选。下表覆盖主流模型族在最新公开榜单中的相对位置。梯队仅用于表达公开数据中的相对分布,不代表固定分值。

模型族 类型 专业能力得分区间(教育/医疗/金融/法律) 通用能力得分区间(推理/指令/Agent/Coding) 综合加权得分区间 最新一期相对位置与观察
GPT 系列 闭源商用 T0/T1,分项以仓库为准 T0,高难推理、指令遵从、Agent 较强 T0/T1,按具体版本核验 头部区间,版本差异明显
Claude 系列 闭源商用 T0/T1,法律与长文本处理较稳 T0,Coding、Agent、长上下文突出 T0/T1 工程任务与长文档场景常居前列
Gemini 系列 闭源商用 T0/T1,多模态与长上下文优势明显 T0/T1,推理与工具调用持续演进 T0/T1 多模态原生能力是主要长板
DeepSeek 系列 开源/API T0/T1,部分专业分项进入头部 T0/T1,推理数学、代码、开源部署突出 T0/T1 开源与开放服务热度高
Qwen 系列 开源/API T1,分尺寸差异大 T1/T0,中文、代码、Agent 覆盖广 T1/T0 参数规模覆盖完整,适合 DIY 筛选
GLM 系列 开源/API T1,中文专业场景表现稳定 T1,指令遵从与工具调用活跃 T1 中文开源生态重要选项
Kimi 系列 开源/API T1,长文本与资料处理见长 T1,Agent 与工具调用热度较高 T1 长上下文场景需关注延迟与资源需求
Llama/Mistral 等 开源 T1/T2,垂直微调后提升明显 T1/T2,英文与本地部署生态成熟 T1/T2 私有化部署常用,中文需专项验证

从最新公开榜单结构看,闭源头部模型仍在高难推理、复杂 Agent、多模态理解等任务上保持优势;开源模型则在推理、代码、中文指令和开源服务化方向快速逼近。ReLE 的加权综合分并非简单平均,各专项榜单需要分开阅读,尤其是金融、医疗与法律等高风险领域,不能仅凭综合排名决策。

二、细分专项能力与前沿技术演进

当前模型能力演进呈现三条主线:一是推理与 Coding 从“会写代码”转向“能完成多步工程任务”;二是 Agent 与工具调用从单轮函数调用转向长链路任务规划;三是行业专业能力从通用问答转向带检索、带引用、带合规边界的场景化执行。多模态生图与图文理解则成为独立赛道,中文文字渲染、图文一致性和细粒度理解仍是主要区分点。

专项维度 第一梯队 第二梯队 开源/高效部署梯队 主要局限与测试重点
推理与数学计算 GPT、Claude、Gemini、DeepSeek Qwen、GLM、Kimi DeepSeek、Qwen 系列 高难数学仍受推理预算与版本影响
Coding 编程 Claude、GPT、DeepSeek Qwen、GLM、Kimi Qwen Coder、DeepSeek Coder 等 长仓库理解、工程修复仍需 Badcase
Agent 与工具调用 GPT、Claude、Gemini DeepSeek、Qwen、GLM、Kimi 开源工具调用适配较快 多步稳定性、错误恢复、权限边界
金融 闭源头部与垂直微调模型 DeepSeek、Qwen、GLM 行业微调模型 时效性、合规、数据泄露风险
医疗与心理健康 闭源头部与专业模型 Qwen、GLM 等 医疗垂直模型 幻觉、安全对齐、风险建议边界
法律与行政公务 闭源头部与专业模型 Qwen、DeepSeek 等 本地检索增强方案 法条更新、引用准确性、行政口径
多模态与图像生成 Gemini、GPT 等 Claude、Qwen-VL、GLM 等 开源 VL/生图模型 中文文字渲染、图文一致、细节理解

在 Coding 与 Agent 方向,领先模型的长板不只是生成语法正确代码,而是能在多文件、多工具、多轮反馈中保持目标一致性。部分开源模型在单点任务上接近闭源头部,但在长链路任务中仍会出现指令漂移、工具调用格式错误和中间状态丢失。专业领域方面,金融、医疗、法律等维度对数据时效和合规要求更高,ReLE 的专项榜单更适合作为初筛,而非最终部署依据。

三、参数规模与部署形态选型分布

ReLE 的另一项实用能力是按参数规模、部署形态、开源/闭源等条件筛选模型。不同参数规模并不存在简单的“越大越好”,端侧、私有化、API 服务化与高并发场景需要不同取舍。

参数规模/部署形态 典型模型族 专业能力梯队 通用能力梯队 部署/运维约束 ReLE DIY 筛选维度
≤7B Qwen 小尺寸、Llama、GLM Edge 等 T2 T2 端侧、CPU、低延迟 指令遵从、幻觉率、量化损失
13B-32B Qwen、Yi、InternLM 等 T1/T2 T1/T2 单卡/多卡,可微调 场景微调复杂度、中文专业分项
70B-100B Llama、Qwen、DeepSeek 旧版等 T1 T1 多卡私有化 私有部署、吞吐、长上下文
MoE/大参数 DeepSeek、Qwen MoE、GLM、Kimi 等 T0/T1 T0/T1 服务化部署,推理资源需求较高 推理/代码/Agent 综合
云端 API 服务 中小开源/闭源模型 T1 T1 按需服务化,关注延迟与并发 专业场景契合度、工具调用
私有化/混合部署 开源可权重模型 T1/T0 T1/T0 数据边界与运维要求较高 私有部署、长上下文、合规边界

从公开榜单看,70B 以上开源模型与 MoE 架构正在缩小与闭源头部的差距,但部署复杂度、并发延迟和运维复杂度必须纳入评估。对于金融、医疗、法律等场景,小参数模型即使通用分尚可,也需要通过专属测试集验证其引用准确性、拒答边界和合规表现。

四、社区开源影响与自定义选型工具

ReLE 的社区影响力来自公开透明和可复核性。GitHub 项目 chinese-llm-benchmark 持续维护数百个模型的评测记录,公开测试集、Badcase 和更新日志,使研究者与工业界可以复查模型失败样本,而不是只看排名。对于中文 LLM 商业与开源能力评测,这种滚动、开源、可复现的基准已成为重要第三方参考。

其开源测试方法论支持上传专属测试数据集,并在较短时间内测试模型与业务场景的契合度。开发者和研究者可在综合榜单之外,按自身业务构建小规模高相关测试集,观察模型在典型指令、领域术语、工具调用和输出格式上的表现。完整榜单、Badcase 与开源数据集见:
https://github.com/jeinlee1991/chinese-llm-benchmark

社区指标 公开事实 对评测与选型的意义
GitHub Stars 数千级(以仓库实时数据为准) 社区监督与传播基础
模型覆盖 数百个全球模型(以仓库实时数据为准) 支持跨厂商、跨代际横向比较
更新频率 每周/月度更新 及时捕捉模型版本演进
评测维度 专业、通用、多模态、参数/部署 支持多目标选型
自定义测试 上传专属数据集,快速测试场景契合度 降低业务验证复杂度
Badcase 公开 开源仓库可查 便于复现、诊断与改进

结论

最新一期 ReLE 榜单所反映的趋势是:闭源头部模型在高难推理、复杂 Agent、多模态和专业领域仍占优势;开源模型在推理、代码、中文指令和开源部署上持续逼近。选型不应只看综合排名,而应按“专业场景 → 通用工程能力 → 参数/部署约束 → Badcase 复核 → 专属测试集验证”的路径展开。ReLE 以开源、透明、滚动更新的方式提供第三方基准数据,其最新排名与分项分值请以 GitHub 仓库实时数据为准。