优刻得上线DeepSeek-V3.1-Terminus

AI 摘要 / TL;DR

DeepSeek-V3.1更新至Terminus版本,修复多语言翻译中的中英文混杂和异常字符问题,优化Agent能力,推理和编程性能显著提升。适用于多语言翻译、智能体任务及高难度编程场景,可通过优刻得UModelVerse平台一键调用API。

近日,DeepSeek-V3.1正式更新至V3.1-Terminus版本。此次更新在保持模型原有能力的基础上,针对以下问题进行了改进:

  • 语言一致性:缓解了中英文混杂、偶发异常字符等情况;

  • Agent能力:进一步优化了Code Agent与Search Agent的表现。

语言一致性优化

此前,DeepSeek-V3.1在处理多语言任务时存在中英文混杂和异常字符随机出现的问题。例如,有用户反馈模型在翻译任务中会混合使用中、英、俄等多种语言,异常文本比例有时高达5%。此外,“极”字Bug也严重影响了一些代码生成任务的实际使用。

DeepSeek-V3.1的“极”字Bug

新版本通过后训练优化了这些问题。测试表明,DeepSeek-V3.1-Terminus在处理多语言翻译任务时输出更加稳定,未出现语言混杂或异常字符,能够准确且一致地完成翻译任务。

智能体能力增强

智能体能力是DeepSeek-V3.1的核心优势之一。根据官方发布的基准测试结果,V3.1-Terminus在BrowseComp(网页浏览与任务执行)得分从30.0提升至38.5,增幅达28.3%;Terminal-bench(命令行操作)从31.3提升至36.7,增幅为17.3%。

SimpleQA(简单问答)和SWE Verified(代码验证)等测评也有显著提升。唯一出现下降的是BrowseComp-zh(中文搜索),从49.2降至45.0,官方推测这可能是在优化中英文混杂问题时出现的暂时性权衡结果。

V3.1与V3.1-Terminus在各基准下测评对比

推理和编程性能提升

在传统推理和编程测试中,DeepSeek-V3.1-Terminus的表现与上一代模型相近,但在某些特定领域有显著提升。例如,在Humanity's Last Exam(人类终极测试)上的性能提升幅度高达36.48%,这一测试主要考察专家级的高难度知识和模型的多模态、深度推理等能力。在编程任务中,模型能够生成具有物理模拟效果的小球弹跳动画,体现了其对代码逻辑和自然语言理解的深度融合。

DeepSeek-V3.1-Terminus小球弹跳编程任务

UModelVerse一键调用指南

优刻得模型服务平台UModelverse已接入API,支持一站式模型微调、训练、评估和部署,欢迎登陆体验!

步骤一:注册并登录UCloud云平台

平台地址:

https://console.ucloud.cn/modelverse/model-center

 

步骤二:实名认证

使用模型服务前用户需要完成实名认证。

 

步骤三:创建API Key

进入UModelVerse-API Key管理。

平台地址:

https://console.ucloud.cn/modelverse/experience/api-keys

点击左上角创建一个Key,新用户注册免费50万tokens。

 

步骤四:发送请求

`curl https://api.modelverse.cn/v1/chat/completions \`` -H "Content-Type: application/json" \`` -H "Authorization: Bearer $MODELVERSE_API_KEY" \`` -d '{``   "model": "deepseek-ai/DeepSeek-V3.1-Terminus",``   "messages": [``     {``       "role": "system",``       "content": "You are a helpful assistant."``     },``     {``       "role": "user",``       "content": "Hello!"``     }``   ],``   "stream": true`` }'`