深度文章

Claude Code 斜杠命令完全指南(2026)

Claude Code 斜杠命令完全指南(2026)

使用斜杠命令把 Claude Code 从聊天机器人改造成确定性执行引擎,并通过完整工作流自动完成整个功能开发周期。

深度 Claude Code Alexander Opalic 阅读 2408 2025-11-22
GPT-5.1-medium实测

GPT-5.1-medium实测

GPT-5.1-medium实测评估了其在多个实际应用场景中的表现。医疗与心理健康领域准确率从75.6%升至77.3%,金融领域从71.3%升至75.4%,agent与工具调用从57.8%升至61.7%,显示在专业任务中能力强化。思考模式适合需要深度推理的复杂场景,但教育和法律行政领域下降,且高token消耗和响应时间可能限制日常应用。

深度 大模型评测及优化NoneLinear 阅读 3039 2025-11-21
GPT-5.1实测:准确率大幅下滑,OpenAI押注"情绪价值"能否奏效?

GPT-5.1实测:准确率大幅下滑,OpenAI押注"情绪价值"能否奏效?

GPT-5.1的战略转型意味着其应用场景的定位可能发生变化。模型在传统基准任务上的性能退步,表明它或许不再以复杂的专业分析、精确的数学推理或严格的指令执行见长。相反,官方强调的“更温暖、更有同理心”的特性,暗示其更适用于注重交互流畅性、情感陪伴和自然对话的场景。因此,对于需要高度精确性和逻辑深度的应用,该版本可能并非最优选择,而在强调沟通体验的领域,其潜在价值有待进一步评估。

深度 大模型评测及优化NoneLinear 阅读 2885 2025-11-20
Gemini 3 Pro体验测试:当AI真的开始"思考",会发生什么?(附体验链接)

Gemini 3 Pro体验测试:当AI真的开始"思考",会发生什么?(附体验链接)

谷歌Gemini 3 Pro作为全球最强多模态推理模型,展示了AI在复杂任务中的推理与执行能力。测试覆盖学习辅助、创意开发、代码生成和长期规划四个场景,要求生成可直接运行的代码或可交付成果。模型能够处理多模态输入,输出符合技术要求的HTML、React应用或策略报告,体现其将抽象需求转化为具体功能的能力,标志着AI在思考与实践结合上的进步。

深度 大模型评测及优化NoneLinear 阅读 1911 2025-11-19
MiniMax-M2实测:轻量级MoE架构带来性能提升与成本优化

MiniMax-M2实测:轻量级MoE架构带来性能提升与成本优化

MiniMax-M2是一款专为编码与智能体应用设计的轻量级MoE模型,其轻量架构在多个能力维度实现了性能与效率的权衡。新版本在保持推理能力稳定的同时,显著优化了语言指令遵从及工具调用能力,准确率提升3.3个百分点。不过在部分专业领域的表现有所回落,体现了针对通用场景的优化侧重。

深度 大模型评测及优化NoneLinear 阅读 1840 2025-11-04
通过 MCP 执行代码:构建更高效的智能体

通过 MCP 执行代码:构建更高效的智能体

直接工具调用会为每个定义和结果消耗上下文。让智能体编写代码来调用工具,扩展性会更好。下面介绍它如何与 MCP 配合工作。

深度 Claude Code 非线智能 阅读 949 2025-11-04
超越权限提示:让 Claude Code 更安全、更自主

超越权限提示:让 Claude Code 更安全、更自主

Claude Code 新增的两项沙箱功能:沙箱化 bash 工具和网页版 Claude Code,通过启用文件系统与网络隔离这两道边界,减少权限提示并提升用户安全性。

深度 Claude Code 非线智能 阅读 1897 2025-10-20
AI 智能体的有效上下文工程

AI 智能体的有效上下文工程

上下文是 AI 智能体的一项关键但有限的资源。在本文中,我们探讨如何有效筛选和管理驱动智能体运作的上下文。

深度 Claude Code 非线智能 阅读 3451 2025-09-29
近期三个问题的事后复盘

近期三个问题的事后复盘

这是一份关于三个 bug 的技术报告,这些 bug 曾间歇性降低 Claude 的响应质量。下文会解释发生了什么、为什么修复花了时间,以及我们正在改变什么。

深度 Claude Code 非线智能 阅读 2895 2025-09-17
我们如何构建多智能体研究系统

我们如何构建多智能体研究系统

我们的 Research 功能使用多个 Claude 智能体,更有效地探索复杂主题。我们分享了构建这一系统时遇到的工程挑战和经验教训。

深度 Claude Code 非线智能 阅读 2810 2025-06-13
构建有效的智能体

构建有效的智能体

我们曾与数十个跨行业构建 LLM 智能体的团队合作。最成功的实现始终使用简单、可组合的模式,而不是复杂框架。

深度 Claude Code 非线智能 阅读 1064 2024-12-19
第 14 / 15 页 · 共 281 篇