
DeepSeek于2025年12月1日发布了AI模型DeepSeek-V3.2-Speciale,该版本是DeepSeek-V3.2的长思考增强版,并集成了DeepSeek-Math-V2的定理证明能力 。其定位为对开源模型推理能力进行探索的版本,旨在拓展模型的长程逻辑处理能力,主要面向研究领域开放使用 。官方网页端、App和API均已更新为DeepSeek-V3.2,Speciale版本目前以临时API服务形式开放 。
该版本采用专家蒸馏、多轨强化学习与工具思维融合的训练体系,通过数学、编程、逻辑推理等领域专家模型生成训练样本,结合GRPO强化学习策略与工具调用思考链的融合机制,构建了结构化任务的学习路径 。与同期发布的通用型DeepSeek-V3.2不同,V3.2-Speciale在主流推理基准测试中取得了与Gemini 3.0 Pro相当的分数,在数学、逻辑和多轮工具调用等任务中表现较好。其技术报告显示,该模型在多项推理基准测试中取得了较高的分数。例如,在数学推理与代码生成等核心指标上较前代有所提升 。该版本聚焦于复杂问题求解,采用Group Relative Policy Optimization策略整合推理奖励、语言一致性得分与任务完成度评估指标,通过任务环境反馈机制实现训练 。
想要了解更多“DeepSeek-V3.2-Speciale”的信息,请点击:DeepSeek-V3.2-Speciale百科
