深度文章

设计能抵抗 AI 的技术评估

设计能抵抗 AI 的技术评估

Claude 不断攻克我们的一道性能工程 take-home 技术题;我们从三轮迭代中学到了什么。

深度 Claude Code 非线智能 阅读 2326 2026-01-21
我的 Claude Code Skills

我的 Claude Code Skills

按类别整理我在 Claude Code 中使用的自定义斜杠命令,以及它们如何加快我的工作流。

深度 Claude Code Amit Jotwani 阅读 2414 2026-01-21
美团 LongCat-Flash-Thinking-2601 体验测试(附完整prompt)

美团 LongCat-Flash-Thinking-2601 体验测试(附完整prompt)

美团 LongCat-Flash-Thinking-2601 的体验测试全面评估了模型的能力,包括工具调用、基础推理和视觉理解。测试发现,该模型在工具类网页开发上表现亮眼,如水印处理工具功能完整交互丝滑,复利计算器UI专业图表实时,公众号排版工具核心功能跑通,实用性强;部分游戏实现出色,如技能五子棋完成度高逻辑清晰。然而,基础推理频繁出错,立体几何推理过程有幻觉,推理陷阱题被套,字符串反转乱序

深度 大模型评测及优化NoneLinear 阅读 2352 2026-01-18
别再让 CLAUDE.md 膨胀:AI 编程工具的渐进式披露

别再让 CLAUDE.md 膨胀:AI 编程工具的渐进式披露

AI 编程工具没有状态,每个会话都要重新开始。解决办法不是把一切都塞进 CLAUDE.md,而是构建分层上下文系统:让经验沉淀在文档里,由专业智能体按需加载。

深度 Claude Code Alexander Opalic 阅读 1948 2026-01-18
Claude Code Skills:斜杠命令完全指南

Claude Code Skills:斜杠命令完全指南

全面掌握 Claude Code 的 Skills 系统:了解斜杠命令的工作方式、可用的内置技能,以及如何为自己的工作流创建自定义 Skills。

深度 Claude Code Claude World 阅读 1091 2026-01-10
揭开 AI 智能体评测的神秘面纱

揭开 AI 智能体评测的神秘面纱

让智能体变得有用的能力,也让它们难以评估。能够在不同部署中奏效的策略,会组合多种技术,以匹配被测系统本身的复杂度。

深度 Claude Code 非线智能 阅读 2287 2026-01-09
MiniMax-M2.1 体验测试(附完整prompt)

MiniMax-M2.1 体验测试(附完整prompt)

MiniMax-M2.1在编程相关基准测试中提升了性能,体验测试覆盖了六大板块。在大数计算中,模型响应虽慢但结果正确;立体几何推理准确;视频理解在多模态测试中为强项。具体数据表明,模型在黄金矿工、太空射击等代码任务完成度高,但3D场景如体素花园全面翻车。测试包括OCR识别、图像理解等,提供完整prompt供参考。

深度 大模型评测及优化NoneLinear 阅读 1897 2026-01-07
智谱 GLM-4.7 体验测试(附完整prompt)

智谱 GLM-4.7 体验测试(附完整prompt)

智谱GLM-4.7是智谱AI 2025年中的旗舰大模型,主打Agentic Coding能力。本次测试评估了其综合表现,结论显示模型在基础推理、创意写作及调研分析等任务上具备扎实且稳定的能力,尤其文本理解与创意生成表现亮眼。然而,在复杂代码生成(如3D场景渲染)与多模态视觉理解等任务上存在明显短板,指令遵循也偶有偏差,距离其宣称的“新标准”尚有差距。

深度 大模型评测及优化NoneLinear 阅读 1110 2026-01-04
阿里 qwen3-max-preview-think 实测

阿里 qwen3-max-preview-think 实测

评测分析了阿里qwen3-max-preview-think模型在实际应用场景中的适用性。该模型在需要深度推理的场景如Agent任务中表现突出,Agent能力提升22.7%,但响应时间延长至182秒,对实时性要求高的应用构成制约。成本敏感场景需谨慎考虑,每千次调用费用86.8元,远高于非思考版本。语言理解能力下降可能影响指令执行,专业领域如教育、金融表现下降,适合特定推理任务而非通用实时交互。

深度 大模型评测及优化NoneLinear 阅读 1276 2025-12-30
谷歌 gemini-3-flash-preview 体验测试(附完整prompt)

谷歌 gemini-3-flash-preview 体验测试(附完整prompt)

通过一系列测试用例,谷歌gemini-3-flash-preview的表现数据被详细记录和分析。数学推理中,大数乘法计算错误,但空间推理和逻辑陷阱题正确;文本处理如字符串反转和语义判别准确无误;创意内容质量高,职场话术贴合语境;多模态能力方面,OCR识别复杂表格准确,视频理解不错。然而,大数口算翻车,视频细节识别不足,这些数据揭示了模型在特定任务上的可靠性和局限性。

深度 大模型评测及优化NoneLinear 阅读 3004 2025-12-28
阿里qwen-plus-think-2025-12-01实测

阿里qwen-plus-think-2025-12-01实测

阿里qwen-plus-think-2025-12-01的实测结果为评估其实际应用价值提供了参考。模型在教育、法律、金融及医疗等垂直领域的任务准确率普遍下滑,这可能影响其在相关场景下的输出可靠性。成本的增加与性能的回落并存,使得其在当前竞争激烈的模型市场中定位显得复杂。值得注意的是,agent能力的提升表明模型在工具调用与任务执行方面进行了优化,这或许预示着其在自动化流程类应用中的潜在优势

深度 大模型评测及优化NoneLinear 阅读 1958 2025-12-25
MiniMax-M2.1 实测

MiniMax-M2.1 实测

本次实测聚焦MiniMax-M2.1在各能力维度的具体变化。模型在金融(+11.1%)、法律(+5.6%)、Agent(+5.4%)等多个垂直领域准确率显著提升,但在语言与指令遵从能力上下降了3.2%。这表明新版在强化专业领域表现的同时,在基础语言理解上存在一定的性能权衡。

深度 大模型评测及优化NoneLinear 阅读 1410 2025-12-23
智谱 GLM-4.7 实测

智谱 GLM-4.7 实测

智谱 GLM-4.7 实测表明,新版本在编程专用模型中实现了多维度性能提升。相比 GLM-4.6,准确率从 68.1% 升至 71.5%,排名上升至第五位。在推理与数学计算、教育、医疗与金融等领域的准确率均有显著增长,分别提升 6.0、5.1、6.0 和 6.5 个百分点。语言理解能力也改善 4.7 个百分点,但 Agent 与工具调用能力略有下降 1.8 个百分点,显示模型在整体优化中存在权衡。

深度 大模型评测及优化NoneLinear 阅读 1916 2025-12-23
小米MiMo-V2-Flash实测

小米MiMo-V2-Flash实测

本次评测基于约1.5万道测试题,量化分析了MiMo-V2-Flash模型的关键性能指标。思考模式平均耗时81秒,单次调用消耗约3994个token;非思考模式耗时59秒,消耗1299个token。其思考模式总分准确率为62.0%,在当前主流模型中排名第55位,与部分顶尖商用模型存在约10个百分点的差距,但在同档位开源模型中处于中等水平。

深度 大模型评测及优化NoneLinear 阅读 1255 2025-12-21
第 12 / 15 页 · 共 281 篇