数据来源非线智能Nonelinear 非线智能团队,维护着GitHub上的开源项目 chinese-llm-benchmark,目前 6,000+ Stars,长期占据中文LLM商业评测类项目Star数第一

github (非线智能)官网正文:

腾讯混元正式开源了新一代 MoE 旗舰模型 Hy4 preview,并同步开放了权重。官方将其定位为面向长上下文、软件工程、复杂智能体及科研生产力任务的新一代主力模型。本次 ReLE 评测侧重中文场景下的综合能力检验,涵盖教育、医疗、金融、法律、推理数学、语言指令、Agent 工具调用及 Coding 八个板块,共计约 1.5 万道题目。相关官方基准数据我们统一放在“3、官方评测”中进行梳理。

hy4-preview版本表现:

  • 测试题数:约1.5万
  • 总分(准确率):74.7%
  • 平均耗时(每次调用):95s
  • 平均token(每次调用消耗的token):6352
  • 平均花费(每千次调用的人民币花费):111.6

1、新旧对决

对比参照模型 hy3,hy4-preview 在 ReLE 中文综合评测中的变化非常剧烈:综合得分大幅跃升,榜单排名直冲前十五;但与之对应的,是单次调用的生成耗时、Token 消耗以及综合花费均出现了数倍乃至数十倍的上涨。具体对比数据如下:

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】腾讯混元 Hy4 Preview 实测:中文榜直冲前15,主打复杂智能体与代码引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】腾讯混元 Hy4 Preview 实测:中文榜直冲前15,主打复杂智能体与代码

*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark

*输出价格单位: 元/百万token


  • 总分与排名显著上移:hy4-preview 综合得分从 64.0% 提升至 74.7%(+10.7 个百分点),总榜排名直接从第 71 位跃升至第 15 位,实现了混元模型在中文综合榜单中的梯队跨越。
  • 推理与数学增长大:推理与数学计算从 60.9% 飙升至 83.0%,大幅提升 22.1 个百分点,是所有细分项中进步最显著的维度,体现了新模型在数理逻辑与深度思考上的重度投入。
  • 语言与指令遵循大幅强化:语言与指令遵从从 58.9% 提升至 78.8%(+19.9 个百分点)。对长指令解析、复杂格式约束和多要求任务的处理能力明显改善,是带动总分上涨的另一大主力。
  • 专业领域全面补齐:法律与行政公务从 78.0% 提至 85.3%(+7.3 个百分点),金融从 80.8% 提至 87.9%(+7.1 个百分点),Agent 与工具调用从 62.0% 提至 68.2%(+6.2 个百分点),展现出均衡的能力结构改善。
  • Coding稳步提升:Coding 从 54.9% 提升至 59.4%(+4.5 个百分点)。在 ReLE 中文评测数据下有所进步,但官方主打的代码仓库级工程能力,仍需结合后文多轮 Agent 基准综合评估。
  • 教育与医疗平稳微升:教育从 56.6% 升至 60.2%(+3.6 个百分点),医疗与心理健康从 86.0% 升至 87.5%(+1.5 个百分点)。医疗基线原本较高,本轮主要以稳固为主。
  • 响应耗时明显拉长:单次平均耗时从 64 秒增加到 95 秒(约为上一代的 1.5 倍)。慢思考和长上下文验证机制虽然换来了更高的准确率,但也牺牲了交互场景下的即时反馈速度。
  • Token膨胀与成本跃升:平均单次 Token 生成量从 618 暴增至 6352(约 10 倍);输出单价由 4.0 元/百万token 调整为 18.0 元/百万token,综合千次调用成本从 1.8 元攀升至 111.6 元(约为上一代的 62 倍)。显然,hy4-preview 从hy3 的低成本定位,转向重度资源消耗的旗舰路线。

2、横向对比

在当前主流大模型的竞争格局中,hy4-preview 作为腾讯混元新一代开源旗舰,究竟处在什么梯队?我们从成本档位、代际梯队和开源商用三个维度进行横向剖析:

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】腾讯混元 Hy4 Preview 实测:中文榜直冲前15,主打复杂智能体与代码
*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark

同成本档位对比

  • 约90至130元档位表现稳健:在千次调用百元左右的高成本区间,hy4-preview(74.7%,111.6元)展现出了相当的竞争力。它在中文场景下,超过了同成本档位的 gpt-6-astra(74.2%,108.1元)、gpt-5.4-high(72.6%,122.3元)和 kimi-k2.6(72.9%,100.4元),但低于国内的 qwen3.7-max(76.9%,99元)、qwen3.8-max(75.4%,107.3元)与 deepseek-v4-pro(74.9%,94.1元)。
  • 响应延迟不占优势:hy4-preview 平均耗时 95 秒,虽快于长思考开源竞品 deepseek-v4-pro(145s)、glm-5.3(154s)和 kimi-k2.6(175s),但明显慢于 qwen3.7-max(51s)、qwen3.8-max(67s)以及海外闭源模型 gpt-6-astra(14s)、gpt-5.4-high(24s)等。
  • 向下看低成本Flash:对比当前势头迅猛的轻量选手 deepseek-v4.1-flash(74.4%,20.7元)、glm-5.3-flash(74.2%,12.7元)和 qwen3.8-flash(74.0%,10元),hy4-preview 虽在总分上略胜一筹(高 0.3~0.7 个百分点),但调用花费高出 5 至 10 倍。

新旧模型对比

  • 混元产品线跃迁:上一代 hy3(64.0%,第71位)仅处在中下游,早期混元版本 hunyuan-2.0-thinking(68.6%)和 hunyuan-2.0-instruct(63.9%)也多在 50 名开外。hy4-preview(74.7%,第15位)的推出,直接将腾讯混元拉入榜单前列。
  • 战略路线重塑:hy3 时代主打 1.8 元/千次的低成本跑批,而 hy4-preview 则转向追求高上限的生产力旗舰。两者不仅是版本迭代,更是产品定位上的转向。

开源/商用对比

  • 开源阵营内部格局:在开源权重模型中,hy4-preview 位列前列,仅次于 kimi-k3、glm-5.3 与 deepseek-v4-pro,并优于一众轻量开源模型。
  • 与商用闭源相比:面对 qwen3.7-max、claude-opus-5、gemini-3.8-flash 等商用天花板,hy4-preview 在中文综合理解上已咬得很紧,为企业私有化部署和深度微调提供了较高水准的开源底座选择。
  • 业务落地权衡:高准确率与深度思考伴随着高延迟与高 Token 开销。如果业务追求快响应与成本,Flash 阵营依然是首选;如果看重私有权重、超长上下文以及复杂代码与智能体任务的上限,hy4-preview 的价值则更为突出。

3、官方评测

根据腾讯混元官方博客(https://hy.tencent.ai/research/hy4-preview)及开源公告,官方重点展示了模型在 MoE 架构创新、长程软件工程及复杂智能体任务上的基准数据:

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】腾讯混元 Hy4 Preview 实测:中文榜直冲前15,主打复杂智能体与代码

软件工程与代码智能体

针对核心主打的软件工程场景,官方公布了一系列高难度代码智能体评测基准:

  • 开源工程基准:SWE-bench Multilingual 达 82.9,SWE-bench Pro 达 65.7,DeepSWE 达 64.3,Terminal-Bench 2.1 达 85.4,NL2Repo-Bench 为 58.9,CyberGym 达 78.4。
  • SWE Atlas代码全流程:Codebase Q&A 得分 64.0,测试用例编写(Test Writing)57.8,代码重构(Refactoring)53.3。
  • 内部工程评测:在 Hy-SWE Max Verified(64.2)与 Hy-CompanyBench V2(62.4)等企业级真实场景中均取得稳健成绩。

Agent、搜索与办公任务

在复杂 Agent 与日常办公协作方面:

  • 智能搜索与工具整合:WideSearch 达到 83.9,OneMillionBench(含工具调用)达 65.4,DRACO 达 77.2。
  • 办公生产力套件:OfficeQA Pro 达 66.2,MCP-Atlas 为 83.7,Toolathlon-Verified 达 74.1,BankerToolBench 为 78.6,Hy-FinAgentBench 达 79.7。
  • 真实工程盲测:官方组织 163 位内部专家对 203 个真实工程任务展开双盲评审,Hy4 preview 均分达 2.99/4(高于 GLM 5.3 的 2.92/4 与 Kimi K3 的 2.94/4),对 GLM 5.3 胜平负为 46.8%/12.8%/40.4%,对 Kimi K3 为 51.2%/7.9%/40.9%。

STEM与推理基准

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】腾讯混元 Hy4 Preview 实测:中文榜直冲前15,主打复杂智能体与代码

在科研与高难度数理推理基准上:

  • 前沿科学评测:GPQA Diamond 达 92.3,SUPERChem 为 66.4,ArXivMath 为 66.6,MathArena Apex 2025 为 74.2,BioMysteryBench 为 71.3,HLE with tools 达 55.4。
  • 早期版本说明:官方同时指出,Hy4 preview 仍处于迭代初期,在复杂任务中仍存在长思考过度自我验证、回答冗长等局限,后续正式版将继续优化预训练与对齐策略。


非线智能官网 https://nonelinear.com.cn/static/models.html 已上线 hy4-preview,,支持一键接入(附接入代码),添加客服 发送 体验金,可享20-50元首充奖励,欢迎对比体验。。

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】腾讯混元 Hy4 Preview 实测:中文榜直冲前15,主打复杂智能体与代码

快速接入代码如下:

from openai import OpenAI

client = OpenAI(     base_url="https://api.nonelinear.com.cn/v1",     api_key="YOUR_API_KEY", )
response = client.chat.completions.create(     model="hy4-preview",     messages=[         {"role": "user", "content": "分析一个大型代码仓库的模块结构,并给出重构风险清单"}     ], )
print(response.choices[0].message.content)