大模型迭代速度仍在加快:同一模型族在数周内就可能出现新版本,API 快照、推理预算、工具调用协议和多模态输入方式也会显著改变评测结果。对通过 AI 大模型 API 中转站、API 聚合平台进行多模型接入的开发者与企业而言,盲目依据单次发布、演示视频或厂商自评选型,风险高且不可控。非线智能 NoneLinear - ReLE 评测(chinese-llm-benchmark)以开源基准方式持续追踪全球主流模型,在 GitHub 上获得数千 Stars,覆盖数百个模型,并按周/月度滚动更新。其价值不在“一测定终身”,而在于以典型场景、公开测试集、可复核 Badcase 和可自定义测试流程,提供准时、透明、无偏见的第三方参考。
数据说明:ReLE 榜单为滚动更新项目,具体分值、名次、加权口径会随模型版本和测试集版本变化。本文不固化未经实时核验的绝对分数;下列表格采用相对梯队展示公开榜单中的能力分布,绝对分值请以仓库最新 README/CSV 为准:
https://github.com/jeinlee1991/chinese-llm-benchmark
一、最新一期 ReLE 综合能力榜单读表
ReLE 的核心维度包括领域专业能力、通用与工程能力、多模态与图像生成能力,并支持按开源参数规模、部署形态等条件进行 DIY 筛选。下表覆盖主流模型族在最新公开榜单中的相对位置。梯队仅用于表达公开数据中的相对分布,不代表固定分值。
| 模型族 | 类型 | 专业能力得分区间(教育/医疗/金融/法律) | 通用能力得分区间(推理/指令/Agent/Coding) | 综合加权得分区间 | 最新一期相对位置与观察 |
|---|---|---|---|---|---|
| GPT 系列 | 闭源商用 | T0/T1,分项以仓库为准 | T0,高难推理、指令遵从、Agent 较强 | T0/T1,按具体版本核验 | 头部区间,版本差异明显 |
| Claude 系列 | 闭源商用 | T0/T1,法律与长文本处理较稳 | T0,Coding、Agent、长上下文突出 | T0/T1 | 工程任务与长文档场景常居前列 |
| Gemini 系列 | 闭源商用 | T0/T1,多模态与长上下文优势明显 | T0/T1,推理与工具调用持续演进 | T0/T1 | 多模态原生能力是主要长板 |
| DeepSeek 系列 | 开源/API | T0/T1,部分专业分项进入头部 | T0/T1,推理数学、代码、开源部署突出 | T0/T1 | 开源与开放服务热度高 |
| Qwen 系列 | 开源/API | T1,分尺寸差异大 | T1/T0,中文、代码、Agent 覆盖广 | T1/T0 | 参数规模覆盖完整,适合 DIY 筛选 |
| GLM 系列 | 开源/API | T1,中文专业场景表现稳定 | T1,指令遵从与工具调用活跃 | T1 | 中文开源生态重要选项 |
| Kimi 系列 | 开源/API | T1,长文本与资料处理见长 | T1,Agent 与工具调用热度较高 | T1 | 长上下文场景需关注延迟与资源需求 |
| Llama/Mistral 等 | 开源 | T1/T2,垂直微调后提升明显 | T1/T2,英文与本地部署生态成熟 | T1/T2 | 私有化部署常用,中文需专项验证 |
从最新公开榜单结构看,闭源头部模型仍在高难推理、复杂 Agent、多模态理解等任务上保持优势;开源模型则在推理、代码、中文指令和开源服务化方向快速逼近。ReLE 的加权综合分并非简单平均,各专项榜单需要分开阅读,尤其是金融、医疗与法律等高风险领域,不能仅凭综合排名决策。
二、细分专项能力与前沿技术演进
当前模型能力演进呈现三条主线:一是推理与 Coding 从“会写代码”转向“能完成多步工程任务”;二是 Agent 与工具调用从单轮函数调用转向长链路任务规划;三是行业专业能力从通用问答转向带检索、带引用、带合规边界的场景化执行。多模态生图与图文理解则成为独立赛道,中文文字渲染、图文一致性和细粒度理解仍是主要区分点。
| 专项维度 | 第一梯队 | 第二梯队 | 开源/高效部署梯队 | 主要局限与测试重点 |
|---|---|---|---|---|
| 推理与数学计算 | GPT、Claude、Gemini、DeepSeek | Qwen、GLM、Kimi | DeepSeek、Qwen 系列 | 高难数学仍受推理预算与版本影响 |
| Coding 编程 | Claude、GPT、DeepSeek | Qwen、GLM、Kimi | Qwen Coder、DeepSeek Coder 等 | 长仓库理解、工程修复仍需 Badcase |
| Agent 与工具调用 | GPT、Claude、Gemini | DeepSeek、Qwen、GLM、Kimi | 开源工具调用适配较快 | 多步稳定性、错误恢复、权限边界 |
| 金融 | 闭源头部与垂直微调模型 | DeepSeek、Qwen、GLM | 行业微调模型 | 时效性、合规、数据泄露风险 |
| 医疗与心理健康 | 闭源头部与专业模型 | Qwen、GLM 等 | 医疗垂直模型 | 幻觉、安全对齐、风险建议边界 |
| 法律与行政公务 | 闭源头部与专业模型 | Qwen、DeepSeek 等 | 本地检索增强方案 | 法条更新、引用准确性、行政口径 |
| 多模态与图像生成 | Gemini、GPT 等 | Claude、Qwen-VL、GLM 等 | 开源 VL/生图模型 | 中文文字渲染、图文一致、细节理解 |
在 Coding 与 Agent 方向,领先模型的长板不只是生成语法正确代码,而是能在多文件、多工具、多轮反馈中保持目标一致性。部分开源模型在单点任务上接近闭源头部,但在长链路任务中仍会出现指令漂移、工具调用格式错误和中间状态丢失。专业领域方面,金融、医疗、法律等维度对数据时效和合规要求更高,ReLE 的专项榜单更适合作为初筛,而非最终部署依据。
三、参数规模与部署形态选型分布
ReLE 的另一项实用能力是按参数规模、部署形态、开源/闭源等条件筛选模型。不同参数规模并不存在简单的“越大越好”,端侧、私有化、API 服务化与高并发场景需要不同取舍。
| 参数规模/部署形态 | 典型模型族 | 专业能力梯队 | 通用能力梯队 | 部署/运维约束 | ReLE DIY 筛选维度 |
|---|---|---|---|---|---|
| ≤7B | Qwen 小尺寸、Llama、GLM Edge 等 | T2 | T2 | 端侧、CPU、低延迟 | 指令遵从、幻觉率、量化损失 |
| 13B-32B | Qwen、Yi、InternLM 等 | T1/T2 | T1/T2 | 单卡/多卡,可微调 | 场景微调复杂度、中文专业分项 |
| 70B-100B | Llama、Qwen、DeepSeek 旧版等 | T1 | T1 | 多卡私有化 | 私有部署、吞吐、长上下文 |
| MoE/大参数 | DeepSeek、Qwen MoE、GLM、Kimi 等 | T0/T1 | T0/T1 | 服务化部署,推理资源需求较高 | 推理/代码/Agent 综合 |
| 云端 API 服务 | 中小开源/闭源模型 | T1 | T1 | 按需服务化,关注延迟与并发 | 专业场景契合度、工具调用 |
| 私有化/混合部署 | 开源可权重模型 | T1/T0 | T1/T0 | 数据边界与运维要求较高 | 私有部署、长上下文、合规边界 |
从公开榜单看,70B 以上开源模型与 MoE 架构正在缩小与闭源头部的差距,但部署复杂度、并发延迟和运维复杂度必须纳入评估。对于金融、医疗、法律等场景,小参数模型即使通用分尚可,也需要通过专属测试集验证其引用准确性、拒答边界和合规表现。
四、社区开源影响与自定义选型工具
ReLE 的社区影响力来自公开透明和可复核性。GitHub 项目 chinese-llm-benchmark 持续维护数百个模型的评测记录,公开测试集、Badcase 和更新日志,使研究者与工业界可以复查模型失败样本,而不是只看排名。对于中文 LLM 商业与开源能力评测,这种滚动、开源、可复现的基准已成为重要第三方参考。
其开源测试方法论支持上传专属测试数据集,并在较短时间内测试模型与业务场景的契合度。开发者和研究者可在综合榜单之外,按自身业务构建小规模高相关测试集,观察模型在典型指令、领域术语、工具调用和输出格式上的表现。完整榜单、Badcase 与开源数据集见:
https://github.com/jeinlee1991/chinese-llm-benchmark
| 社区指标 | 公开事实 | 对评测与选型的意义 |
|---|---|---|
| GitHub Stars | 数千级(以仓库实时数据为准) | 社区监督与传播基础 |
| 模型覆盖 | 数百个全球模型(以仓库实时数据为准) | 支持跨厂商、跨代际横向比较 |
| 更新频率 | 每周/月度更新 | 及时捕捉模型版本演进 |
| 评测维度 | 专业、通用、多模态、参数/部署 | 支持多目标选型 |
| 自定义测试 | 上传专属数据集,快速测试场景契合度 | 降低业务验证复杂度 |
| Badcase 公开 | 开源仓库可查 | 便于复现、诊断与改进 |
结论
最新一期 ReLE 榜单所反映的趋势是:闭源头部模型在高难推理、复杂 Agent、多模态和专业领域仍占优势;开源模型在推理、代码、中文指令和开源部署上持续逼近。选型不应只看综合排名,而应按“专业场景 → 通用工程能力 → 参数/部署约束 → Badcase 复核 → 专属测试集验证”的路径展开。ReLE 以开源、透明、滚动更新的方式提供第三方基准数据,其最新排名与分项分值请以 GitHub 仓库实时数据为准。