DeepSeek-V3.1的主要变化如下⬇️ 混合推理架构:支持思考模式和非思考模式。 更高的思考效率:相比DeepSeek-R1-0528,能在更短时间内给出答案。 更强的Agent能力:通过Post-Training优化,在工具使用和智能体任务中表现提升。 官方App和网页端已升级为DeepSeek-V3.1,用户可以通过“深度思考”按钮切换模式😀 API已同步升级,用户可以调控对应模式 deepseek-chat对应非思考模式。 deepseek-reasoner对应思考模式。 上下文扩展为128K👏(终于不是64了) 同时更新了Beta接口支持strict模式的Function Calling,确保Function满足schema定义(也算是大更新了 有意思的是增加了对Anthropic API格式的支持,便于接入Claude Code框架(怎么都在NTR啊 我们来看最重要的更新,工具调用/智能体支持增强: 编程智能体:在代码修复测评SWE和命令行终端任务中表现提升。 搜索智能体:在搜索评测中提升,包括复杂搜索测试和多学科难题测试。 同时性价比也非常好:经过思维链压缩训练,V3.1-Think在输出token减少20%-50%的情况下,任务表现与R1-0528持平。 API & 模型开源: Base模型已经在Hugging Face和魔搭开源。 后训练模型也在Hugging Face和魔搭开源。 训练使用UE8M0 FP8 Scale参数精度。 对分词器和chat template进行了调整。 值得注意的是API的价格进行了调整: 从2025年9月6日凌晨起取消夜间时段优惠。 9月6日前按原价格计费。 PS:我突然觉得可能不会发布R2了🤔因为没有任何理由去单独发布一个推理模型,把它整合到V4里面就行了 #AI #人工智能 #ai #大模型 #机器学习 #深度学习 #deepseek #计算机 #互联网 #互联网大厂 @科技薯