大模型评测第2弹:真实开发任务里,GLM 5.2、Claude、GPT 谁更值得选?

AI 摘要 / TL;DR

本文基于OpenCode工具,评测了GLM 5.2、Claude、GPT等7个模型在真实开发任务(团队任务看板系统)中的综合能力、效率与成本。结果显示GLM 5.2综合得分最高且成本最低,Claude效率最高但成本较高。适合开发者根据预算和效率需求选型。

测试说明

测试工具: OpenCode。为尽量减少 Claude Code(CC)和 Codex 对特定厂商模型的适配优化影响,本次测试统一使用 OpenCode。

测试模型: GLM 5.2、Claude Opus 4.8、ChatGPT 5.5、DeepSeek V4 Pro、Qwen3.7 Max、Kimi K2.6、GLM 5.1。

测试任务: FlowTask 团队任务看板系统,覆盖需求分析、产品设计、开发、测试及 UCloud 云端部署的完整流程。

测试环境: UCloud 云服务器、Ubuntu 镜像、公网 IP、UCloud 防火墙及安全组、Docker Compose、PostgreSQL。

验收账号: admin、user1、user2,密码均为 password。

费用口径: 以 UCloud 模型服务平台账单截图中的“筛选合计 / 订单总额”为准。

评测团队: UCloud 技术研究院。

生成日期: 2026 年 6 月 17 日。

一、测试结论 1.1 各阶段各模型评分 下表采用 200 分制:10 个评分项,每项满分 20 分,最小评分粒度为 1 分。综合分为各阶段整数得分相加,便于直接横向比较。 1.1 各模型综合排名

本次评测采用 200 分制,共设置 10 个评分项,每项满分 20 分。为便于阅读,完整数据拆分为综合排名、开发能力、测试交付和效率成本四张表。

排名模型综合分质量分验收问题数自修 Bug 数
1GLM 5.2189⁄20017⁄20214
2Claude Opus 4.8186⁄20015⁄20110
3ChatGPT 5.5182⁄20016⁄2028
4GLM 5.1151⁄20010⁄2038
5Qwen3.7 Max148⁄20010⁄2037
6DeepSeek V4 Pro146⁄2009⁄20518
7Kimi K2.6136⁄2008⁄20412

1.2 需求理解与开发能力

模型需求理解 RU功能设计 FD架构设计 AD前端 FE后端 BE
GLM 5.22020181720
Claude Opus 4.82020181619
ChatGPT 5.52020161820
GLM 5.12020181419
Qwen3.7 Max1718161418
DeepSeek V4 Pro1818181318
Kimi K2.61718161618

注:以上各项满分均为 20 分。

1.3 测试、问题处理与部署能力

模型测试 TS问题处理 PD代码质量 CR部署 DP
GLM 5.219201820
Claude Opus 4.820201820
ChatGPT 5.519201518
GLM 5.116101311
Qwen3.7 Max16131313
DeepSeek V4 Pro16101313
Kimi K2.61610107

注:以上各项满分均为 20 分。

1.4 开发效率与实际成本

模型最终时长实际费用Token 总数人工介入次数
GLM 5.21h55m25s¥50.7416.62M0
Claude Opus 4.81h28m09s¥808.1819.82M0
ChatGPT 5.51h41m03s¥223.0111.16M1
GLM 5.11h31m45s¥63.7121.38M2
Qwen3.7 Max1h54m34s¥148.2724.93M2
DeepSeek V4 Pro2h43m43s¥39.7049.23M4
Kimi K2.63h43m37s¥42.4523.76M3

人工验收问题数仅统计人工测评记录及报告中明确出现的交付后问题,包括核心功能 Bug、部署问题以及文档或设计错误,不将每个评分细项的扣分都计为 Bug。

开发自修 Bug 数是指模型在开发、测试和部署过程中自行发现并完成修复的问题数量。该数据不能单独用于判断模型能力,还需要结合最终验收问题数、人工介入次数和整体交付质量综合分析。

人工验收问题数口径:只统计人工测评记录和报告中明确出现的交付后问题、核心功能 Bug、部署问题或文档/设计错误;不把每个评分细项扣分都算作 Bug。开发自修 Bug 数口径:只统计模型在正式 FT session 中自己遇到失败/报错/测试不通过/部署异常后,主动定位、修改并复测的闭环事件;同一根因多次重试合并一次;用户人工指出的问题不计入。 本轮新增 GLM 5.2 后,综合得分最高的是 GLM 5.2,综合分 189/200。它的突出优势是 人工验收 2 个小 Bug、0 人工介入、本地和云端 E2E 均通过;扣分主要来自长文本标题溢出、首页缺少注册入口、Plan/README 中 SSH 用户仍写 root@IP、少量 E2E 断言偏浅、部署元数据含敏感字段。 Claude Opus 4.8 综合分 186/200,位列第二,费用 808.18 元,总耗时 1h28m09s。 ChatGPT 5.5 综合分 182/200,位列第三,费用 223.01 元,总耗时 1h41m03s。它的功能和测试结果很好,费用明显低于 Claude;但过程中有 1 次人工介入,主要是部署断点重启。按“第一次没实现就是 0 分”的口径,部署重启恢复能力细项为 0/2。 低成本模型里,Deepseek V4 ProKimi K2.6 费用较低,但实际开发和部署后的使用问题比较明显。Deepseek 主要问题是前后端接口约定和部署后使用时出现的 Bug;Kimi 主要问题是部署链路、安全边界和资源治理。 1.2 推荐建议(关键)

角色推荐模型推荐理由使用条件风险提示
综合首选GLM 5.2综合分最高,人工验收 2 个小 Bug,全程 0 人工介入适合正式项目开发、云端部署、希望少返工的场景费用 50.74 元,成本较低;正式采用前仍需工程师检查敏感信息和部署文档
高质量备选Claude Opus 4.8全程 0 人工介入,自主完成度好适合关键任务、复杂需求,或者希望尽量少安排人中途接管的场景费用 808.18 元,本轮成本显著高于其它模型
性价比首选ChatGPT 5.5综合分第二,费用 223.01 元,明显低于 Claude适合正式项目开发,希望质量和费用比较平衡时优先使用有 1 次人工介入,仍建议安排工程师检查部署过程、架构实现和测试覆盖
低成本备选GLM 5.1综合分 151/200,费用 63.71 元,成本明显低于 GPT/Claude适合预算有限的任务,但需要安排人重点检查和维护前端前端实际使用问题较多,不建议直接交付上线,建议多花人力审核和维护
暂不优先Qwen3.7 Max综合分 148/200,设计较完整,但费用高于 GLM,交付质量没有明显优势可以后续再测一次,看部署和前端功能是否改善本轮状态流转 405、邀请功能缺失,性价比不突出
低成本实验Deepseek V4 Pro费用最低 39.70 元,后端和状态机有一定基础适合低成本试用或生成局部代码部署后使用时出现的 Bug 多,必须有人审核、修 Bug 和重新验证
不建议直接上线Kimi K2.6费用低,但部署和资源治理风险突出只适合非关键任务或低成本实验部署、安全和资源使用问题比较突出,不建议直接交付上线

按场景看:

场景建议模型理由
任务关键,希望尽量少人工介入GLM 5.2 / Claude Opus 4.8两者均 0 人工介入;GLM 5.2 本轮人工验收 2 个小 Bug
正式项目开发,追求质量和费用平衡ChatGPT 5.5综合分接近 Claude,费用明显更低,但需要工程师检查部署过程
成本敏感但仍希望有较完整交付GLM 5.1费用低于 GPT/Claude,得分高于其它低价模型
原型、批量尝试、非关键任务Deepseek V4 Pro / Kimi K2.6价格低,但需要安排人检查、修 Bug 和处理部署问题

1.3 模型画像

模型本轮画像适合场景不适合场景
GLM 5.2本轮综合分最高,0 人工介入,仅有长文本标题溢出、首页缺少注册入口两个小 Bug,云端 E2E 通过正式项目开发、云端部署、质量优先场景正式项目仍需检查长文本显示、注册入口和敏感信息治理
Claude Opus 4.8自主完成度好,0 人工介入,但价格最高关键任务、复杂需求、高风险需求分析默认日常开发,成本压力大的任务
ChatGPT 5.5功能和测试表现强,费用中等,但部署断点重启需要人工介入正式开发、质量和成本平衡场景完全不希望人工接管部署的场景
GLM 5.1后端较完整、价格低,但前端和部署细节需要人盯预算有限、有工程师审核的任务直接交付上线
Qwen3.7 Max方案较完整,但实际交付暴露状态流转和邀请功能问题后续复测观察当前不建议作为优先选项
Deepseek V4 Pro费用最低,但前后端接口问题多,人工介入多低成本试验、局部代码生成正式项目上线
Kimi K2.6费用低,但部署、安全、资源治理问题明显非关键低成本实验云端部署、需要稳定交付的任务

二、测试数据概览 2.1 测试任务简介 本次测评项目是一个团队任务看板系统,要求模型从需求分析、开发、测试到 UCloud 部署尽量完整交付。整体要求分为两部分:开发要求和部署要求。

开发要求

模型需要实现一个可实际使用的团队任务管理系统,核心功能包括:

用户注册与登录: 支持默认账号、JWT 鉴权和基础登录状态管理。

项目管理: 支持查看项目列表、进入项目详情,并能够查看项目成员和项目任务。

成员邀请与权限管理: 项目成员分为 editreadonly 两种角色。edit 用户可以邀请成员、创建任务、编辑任务、删除任务和推进任务状态;readonly 用户只能查看,不能进行任何写操作。

任务管理: 支持创建、编辑和删除任务。任务字段包括标题、描述、负责人、优先级、状态和截止日期。

状态流转: 任务状态需要按照既定规则推进,后端必须拦截非法状态流转。例如,任务不能直接从“待办”跳转到“完成”。

看板与日历: 支持三列看板视图和日历视图,任务能够按照状态和截止日期正确展示。

筛选功能: 支持按照项目成员和任务状态筛选任务,并且在看板视图与日历视图之间切换时,筛选条件需要保持一致。

数据约束: 正确实现字段类型、字段长度和枚举值限制,包括用户名、密码、任务标题、任务描述、成员角色、任务优先级和任务状态等。

自动化测试: 包含前端 E2E 测试和后端单元测试,覆盖权限控制、状态流转、任务筛选、日历展示等关键场景。

部署要求

模型不仅需要完成代码开发,还需要将服务部署到 UCloud 云服务器,并完成公网环境验收。具体要求包括:

创建云资源: 使用 UCloud CLI 创建云服务器和公网 IP,并记录 UHostIdEIPId、公网 IP、Region、Zone 等资源信息。

正确连接服务器: 本轮使用的 Ubuntu 镜像默认不适合直接通过 root 用户登录。模型需要识别 SSH 用户问题,优先使用 ubuntu@公网IP 登录,并通过 sudo 执行部署命令。

配置网络访问: 配置 UCloud 防火墙或安全组,确保前端 80 端口以及后端 Health/API 端口可以通过公网访问。

Docker Compose 部署: 使用 Docker Compose 部署前端、后端和 PostgreSQL 数据库,并正确配置 Volume、环境变量、端口映射和服务重启策略。

完成公网验收: 确认前端页面可以访问、后端 Health 接口正常、默认账号能够登录、种子数据已正确初始化,并确保关键 API、后端单元测试和前端 E2E 测试通过。

支持故障恢复: 服务器重启后,前端、后端和数据库服务能够自动恢复,避免因 Docker 服务未自动启动而导致系统不可用。

提供运维说明: 提供部署、调试和云资源清理说明,避免测试结束后出现资源残留、持续计费或误删资源等问题。 2.2 各模型总体结果 1.1 综合排名与交付质量

排名模型综合分质量分人工验收问题数开发自修 Bug 数
1GLM 5.2189/20017/20214
2Claude Opus 4.8186/20015/20110
3ChatGPT 5.5182/20016/2028
4GLM 5.1151/20010/2038
5Qwen3.7 Max148/20010/2037
6DeepSeek V4 Pro146/2009/20518
7Kimi K2.6136/2008/20412

1.2 开发效率、成本与交互数据

模型最终时长实际费用Token 总数对话消息数人工介入次数
GLM 5.21小时55分25秒¥50.7416.62M2050
Claude Opus 4.81小时28分09秒¥808.1819.82M1710
ChatGPT 5.51小时41分03秒¥223.0111.16M841
GLM 5.11小时31分45秒¥63.7121.38M1672
Qwen3.7 Max1小时54分34秒¥148.2724.93M2102
DeepSeek V4 Pro2小时43分43秒¥39.7049.23M2594
Kimi K2.63小时43分37秒¥42.4523.76M2913

指标说明:

  • 人工验收问题数:指任务交付后,由人工验收发现的核心功能 Bug、部署问题以及文档或设计错误。
  • 开发自修 Bug 数:指模型在开发、测试和部署过程中自行发现并完成修复的问题数量。
  • 对话消息数:指任务执行过程中,模型与 OpenCode 之间产生的对话消息总次数。
  • 人工介入次数:指因模型无法自行推进、执行方向出现明显偏差或任务流程中断,需要人工提供额外指令或修正的次数。
  • 实际费用:以 UCloud 模型服务平台账单截图中的“筛选合计 / 订单总额”为准。

问题数量明细见 附录 E:问题数量明细
2.3 成本与效率观察

模型综合分实际费用(¥)每 1 分成本(¥/分)Token 总数每 1M Token 成本(¥)
GLM 5.2189/20050.740.2716.62M3.05
Claude Opus 4.8186/200808.184.3519.82M40.77
ChatGPT 5.5182/200223.011.2311.16M19.98
GLM 5.1151/20063.710.4221.38M2.98
Qwen3.7 Max148/200148.271.0024.93M5.95
Deepseek V4 Pro146/20039.700.2749.23M0.81
Kimi K2.6136/20042.450.3123.76M1.79

解释:成本效率只反映账单费用与得分、Token 的比例,不代表最终交付质量。低费用模型如果后续需要反复人工检查、修 Bug 和重新部署,真实成本会被放大。
2.4 部署访问地址和默认账号

已脱敏处理。
2.5 测试方式和数据来源

  1. 使用 opencode session list 查找本轮带 FT 标记的 session。
  2. 使用 opencode export <session_id> > evaluations/models/<model>/sessions/<session_id>.json 导出 session。
  3. 从 session 中抽取 AI 返回的需求/技术方案文档、需求分析阶段 assistant 消息数、开发阶段 assistant 消息数和 Token 消耗。
  4. 结合被测代码、部署脚本、测试文件、session 过程记录和人工测评记录打分。
  5. 对已经启动的云端服务进行接口、页面、默认账号、种子数据和 E2E 复查。
  6. 将人工提供的实际账单费用写入最终结果。
    2.6 各阶段各模型实际表现
    各模型各阶段评分已放在 1.1 各阶段各模型评分 总表中。该表采用 200 分制,同时展示阶段分、质量分、最终时长、实际费用、Token 总数和人工介入次数,作为本报告最前置的核心数据。
    附录 A:评分标准
    总分采用 200 分制,共 10 个评分项,每项满分 20 分:RU、FD、AD、FE、BE、TS、PD、CR、DP 和质量分。
    附录 C、附录 D 均采用 20 分制细项分,用于审计每个阶段具体扣在哪里;最终报告和排序以 200 分制为准。
阶段满分主要评估内容评分依据
需求理解 RU20实体、字段约束、权限、状态机、筛选/日历理解只看 Plan/需求方案输出文档
功能设计 FD20API、E2E、UT 设计完整性Plan 为主,代码用于验证设计是否落地
架构设计 AD20技术栈、DDL、分层、部署架构、阶段拆分Plan 为主,代码/部署材料用于验证一致性
前端实现 FE20看板、日历、筛选、权限入口、弹窗、响应式、动画实际前端代码与部署验收
后端实现 BE20认证、权限、字段约束、状态流转、筛选、种子数据实际后端代码、接口行为和数据库结构
功能测试 TS20Playwright E2E、后端 UT、覆盖关键风险点测试代码和运行结果
问题处理 PD20遇到问题后的定位、修复、复测能力session 日志、人工介入记录
代码质量检查 CR20可维护性、安全性、分层、接口约定一致性实际代码和运行结果
UCloud 部署 DP20UCloud CLI 创建、SSH 登录、防火墙、Docker 部署、公网验收、重启恢复、调试清理部署脚本、云端检查、session 记录
质量分20Bug 严重程度、实现偏差、交付风险代码、session、人工测评记录综合判断

关键口径:
需求理解只看 AI 返回的需求/技术方案文档,不能用最终代码实现反向补分。
功能设计和架构设计采用“Plan 为主、代码为辅”。代码只能验证设计是否兑现,不能替代缺失的设计。
前端、后端、测试、部署和质量分必须看实际代码、session、部署结果和人工测评记录。
前端功能缺失算 Bug,不在评测中修复,只记录并扣分。
A.1 详细评分细则
以下每个阶段都按 20 分制直接评分。每张细项表的“分值”相加均为 20 分,附录 C 和附录 D 也使用同一套分值,不再使用旧的 12/10/16/18 分细项分配。
A.1.1 需求理解 RU(20 分)
本阶段只看 AI 在 Plan/需求阶段返回的需求或技术方案文档,不看最终代码。

细项分值评分标准典型扣分情况
RU-01 实体与关系识别5准确识别 users、projects、project_members、tasks 四类核心实体,并说明用户、项目、成员、任务之间的关系漏掉项目成员关联实体;把成员关系简化成任务字段;实体关系图错误且影响理解
RU-02 字段类型与约束还原5明确写出 role、priority、status 枚举;用户名 3-20 字符且唯一;密码不少于 6 位;标题 1-100 字符;描述不超过 500 字符漏写枚举值;漏写长度限制;把约束只写成泛泛校验;最终代码实现了但 Plan 没写也不能补分
RU-03 权限模型理解4

A.1.2 功能设计 FD(20 分)
本阶段 Plan 为主,代码只用于验证设计是否兑现。Plan 没写的内容不能靠最终代码反向补满。

细项分值评分标准典型扣分情况
FD-01 API 设计8Plan 中列出 12 个核心接口,包含方法、路径、鉴权、权限、关键请求/响应和错误码接口数量不全;路径或方法不稳定;状态流转接口和前端实际调用不一致
FD-02 E2E 设计6设计 E2E-01~E2E-15,覆盖登录、项目、邀请、任务 CRUD、状态流转、筛选、日历、readonly、响应式、部署访问只有泛泛测试计划;未覆盖 readonly 或非法状态流转;未要求 Python Playwright 或 data-testid
FD-03 UT 设计6设计 UT-01~UT-21,覆盖认证、权限、字段约束、状态机、筛选、日历查询、种子数据后端单测设计缺失;只测试 happy path;未覆盖 readonly 403 和非法状态流转

A.1.3 架构设计 AD(20 分)
本阶段 Plan 为主,代码和部署材料用于验证架构是否落地。

细项分值评分标准典型扣分情况
AD-01 技术栈选型4明确前后端、数据库、Docker、测试工具和约束,例如 FastAPI、React、PostgreSQL、原生 SQL/禁止 ORM 等技术栈不清;选型与要求冲突;测试或部署工具缺失
AD-02 DDL 与数据约束5给出四表 DDL,包含主键、外键、唯一约束、枚举 CHECK、时间字段、必要索引DDL 缺失;字段约束只写在文字里;缺少外键或枚举 CHECK
AD-03 分层与权限架构4说明后端 routers/services/repositories/deps/permissions 等边界,前端 API、页面、组件、状态分层清楚核心逻辑堆在单文件;权限校验分散;SQL 和路由混杂
AD-04 部署架构4说明 Docker Compose、前端/后端/数据库服务、volume、环境变量、端口、健康检查、UCloud 网络/防火墙未说明 UCloud 防火墙;未说明健康检查;Docker 自启动或重启策略缺失
AD-05 阶段拆分和交付物3有 Plan -> Build -> Test -> Deploy -> Acceptance 阶段拆分,每阶段有交付物或验收标准阶段不清;没有验收口径;部署和测试混在一起

A.1.4 前端实现 FE(20 分)
本阶段看实际前端代码、页面行为、E2E 和人工检查结果。

细项分值评分标准典型扣分情况
FE-01 基础页面与导航3登录/注册、项目列表、项目详情、顶部导航、基础视觉规范可用页面缺失;入口混乱;样式丢失
FE-02 看板与任务卡4三列看板、列计数、任务卡字段、优先级、截止日期、状态推进按钮完整任务字段缺失;状态按钮错误;标题溢出严重影响展示
FE-03 任务与成员操作3创建/编辑/删除任务、邀请成员、成员列表或成员管理入口可用缺少邀请功能;缺少成员管理组件;表单字段类型错误
FE-04 筛选与日历3成员筛选、状态多选、视图切换保持筛选、日历月视图、任务详情弹窗可用筛选类型错误;切换视图丢筛选;首次进入项目任务不加载
FE-05 权限入口收敛3readonly 用户隐藏邀请、创建、编辑、删除、状态推进等写入口后端能 403 但前端仍显示写入口;readonly 可见状态推进按钮
FE-06 动画与交互反馈2FAB、任务进入、弹窗、按钮、Toast、删除动效符合要求删除动画未触发;动画方向/距离不符合;反馈过浅
FE-07 加载、空状态、错误提示1Spinner、Toast、空状态、错误提示可见,加载时不白屏首屏空白;错误无提示;刷新登录态丢失
FE-08 响应式适配1移动端、中屏、桌面端布局稳定,文本不溢出、不遮挡三断点不严格;长标题不换行;移动端布局只检查可见未检查可用

A.1.5 后端实现 BE(20 分)
本阶段看实际后端代码、接口行为、数据库结构和当前/历史验证结果。

细项分值评分标准典型扣分情况
BE-01 核心接口完整性4注册、登录、用户、项目、成员、任务 CRUD、health 等接口完整登录路径 404;核心接口缺失;方法不匹配
BE-02 状态流转校验4后端真实校验状态机,非法流转返回 400只靠前端限制;done 直接回 todo;非法流转成功
BE-03 权限校验4readonly 写操作 403,非项目成员访问 403,edit 权限可写readonly 后端可写;非成员可访问;权限只在前端控制
BE-04 鉴权机制3JWT、Header 校验、过期/无效 token 401,除公开接口外均需鉴权token 不校验;接口裸奔;错误码混乱
BE-05 字段约束落地2用户名、密码、role、priority、status、标题、描述等约束在路由/Pydantic/DDL 中落实只在前端校验;DDL 无 CHECK;类型不一致导致 422
BE-06 初始化与种子数据2数据库初始化、默认账号、示例项目、成员和任务幂等可用默认账号不可用;种子数据缺失;重启后数据丢失
BE-07 查询与日历支持1支持成员筛选、状态多选、截止日期范围或 year/month 等日历查询查询参数缺失;只前端本地过滤;日历范围不可查

A.1.6 功能测试 TS(20 分)
本阶段看测试代码和测试运行结果,不能只看测试文件是否存在。

细项分值评分标准典型扣分情况
TS-01 E2E 工具和可运行性4使用 Python Playwright,使用 data-testid,支持 BASE_URL 指向云端E2E 不可运行;只能本地跑;定位器脆弱
TS-02 E2E 覆盖和通过率4E2E-01~E2E-15 覆盖完整,云端或本地实际通过编号覆盖但断言浅;未跑云端;部署后使用时出现的 Bug 未覆盖
TS-03 readonly/权限 E2E3覆盖 readonly 写入口隐藏和后端 403 等关键权限场景只断言一个按钮隐藏;未覆盖状态推进/编辑/删除
TS-04 独立测试数据库3UT 使用独立测试数据库,不污染生产数据,结构尽量同构使用生产库;SQLite 替代 PostgreSQL 导致约束差异
TS-05 UT 覆盖完整性3UT-01~UT-21 覆盖认证、项目、成员、任务、筛选、日历只测 happy path;缺少字段约束或筛选测试
TS-06 风险点单测3覆盖非法状态流转、readonly 403、非成员 403 等风险点测试未挡住 P1/P2 Bug;状态机没有单测

A.1.7 问题处理 PD(20 分)

细项分值评分标准典型扣分情况
PD-01 问题识别8能从日志、报错、接口返回中准确识别问题根因反复试错但不定位;需要用户指出错误
PD-02 修复闭环8给出正确修复并完成复测,能处理部署、防火墙、SSH、接口等问题修复不完整;需要人工介入继续;修错方向
PD-03 验证记录4记录复测命令、结果、默认账号、公网 health、E2E 等证据只口头说完成;缺少复测记录

A.1.8 代码质量检查 CR(20 分)

细项分值评分标准典型扣分情况
CR-01 代码结构与可维护性8模块边界清楚,路由、权限、SQL、组件拆分合理单文件堆叠;前后端接口约定混乱;重复逻辑多
CR-02 安全与错误处理7密码哈希、JWT、安全配置、参数化 SQL、统一错误处理较好明文密码;SQL 注入风险;敏感信息硬编码
CR-03 接口约定一致性与细节质量5前后端字段、路径、状态、错误码一致,UI 细节和测试口径可靠API 路径 404/405;字段类型不一致;视觉/响应式细节明显偏差

A.1.9 UCloud 部署 DP(20 分)

细项分值评分标准典型扣分情况
DP-01 UCloud CLI 创建资源2能用 UCloud CLI 创建云服务器和公网 IP,并说明关键参数创建失败;命令缺失;需要用户手动创建
DP-02 资源信息记录2记录 UHostId、EIPId、公网 IP、Region/Zone、防火墙等资源记录混乱;缺少公网 IP、UHostId 或防火墙信息
DP-03 SSH 登录和服务器连接3能识别 Ubuntu 镜像登录用户,正确使用 ubuntu@IP + sudo 连接和部署反复使用 root 登录;SSH 阻塞;需要用户确认后继续
DP-04 防火墙和公网端口4正确配置 UCloud 防火墙/安全组,放行前端和后端访问端口忘记配置防火墙;公网无法访问;端口策略不清
DP-05 Docker Compose 部署3前端、后端、PostgreSQL 三服务,volume、环境变量、端口映射和构建流程正确服务缺失;配置错误;Docker 安装或构建不稳定
DP-06 公网功能验收3前端 HTTP 200,后端 health 可用,默认账号可登录,种子数据存在,关键 API/E2E 通过页面能打开但核心功能报错;health/API 不可用
DP-07 重启恢复能力2服务器关机再开机后,Docker 和业务服务能自动恢复Docker 不自启动;重启后服务不可用;需要人工再部署
DP-08 调试和清理说明1README/scripts 提供日志查看、问题排查和资源清理说明,删除资源需确认无清理说明;清理脚本危险;部署不可恢复

A.1.10 质量分(20 分) 质量分基于 Bug 和实现偏差综合判断,按 20 分直接打分。

等级说明典型问题影响
P1核心业务逻辑或部署不可用readonly 后端写操作成功;非法状态流转成功;公网无法访问;登录主流程完全失败严重影响交付,质量分大幅扣分
P2重要需求偏差或核心交互失败前端缺少邀请/成员管理;状态流转 405;任务编辑 422;刷新登录态丢失;首次项目页任务不加载明显影响用户检查和上线判断,按数量和范围扣分
P3中低风险偏差动画不符合、响应式断点不严格、长标题溢出、测试断言偏浅不一定阻断主流程,但影响完整度和专业度

附录 B:各模型阶段评分备注 本附录的阶段得分、附录 C 的细项矩阵、附录 D 的扣分明细均采用同一套 20 分制B.0 GLM 5.2

指标结果
综合分189/200
质量分17/20
最终时长1h55m25s
实际费用¥50.74
Token 总数16.62M
对话消息总次数205
人工介入次数0
阶段展示满分得分得分备注
需求理解2020Plan 文档完整还原实体、字段约束、权限、状态机、筛选/日历
功能设计202012 个 API、E2E-0115、UT-0121 完整
架构设计2018架构、DDL、Docker、UCloud 完整;扣 Plan/README 仍写 root SSH 口径
前端实现2017看板、日历、筛选、邀请、权限入口基本完整;扣首页缺少注册入口、删除动画细节和长文本标题溢出
后端实现2020认证、权限、状态机、字段约束、筛选、种子数据完整
功能测试2019后端 23 个单测、本地和云端 E2E 15/15 通过;扣少量断言偏浅
问题处理2020开发、测试、部署问题均独立定位并闭环
代码质量检查2018分层清晰;扣部署元数据敏感字段和 SSH 文档口径
UCloud 部署验收2020UCloud 创建、Docker、防火墙、公网验收、云端 E2E 均完成

主要扣分点:首页只显示登录入口、没有注册入口;长文本标题溢出;Plan/README 中保留 root@IP,实际部署靠 ubuntu 用户完成;E2E 少量断言偏浅;deploy-meta.json 含 SSH 密码字段,正式项目需要更严格的敏感信息治理。 B.1 ChatGPT 5.5

指标结果
综合分182/200
质量分16/20
最终时长1h41m03s
实际费用¥223.01
Token 总数11.16M
对话消息总次数84
人工介入次数1
阶段展示满分得分得分备注
需求理解2020Plan 文档完整还原实体、字段约束、权限、状态机、筛选/日历
功能设计2020Plan 输出完整设计 12 个 API、E2E-0115、UT-0121,且代码基本对应
架构设计2016Plan 架构很完整;实际代码未按 Plan 的 routes/repositories/permissions 分层充分落地
前端实现2018主流程、权限收敛、看板/日历/筛选完整;扣删除动画、中屏紧凑响应式和长标题溢出
后端实现2020认证、权限、状态机、字段校验、筛选、种子数据和统一响应完整
功能测试2019UT 21/21、E2E 15/15 通过;扣 E2E-09/13/14 断言偏浅
问题处理2020部署中定位并解决 SSH 用户、Docker 拉取、防火墙公网访问等问题
代码质量检查2015安全和参数化较好;扣单文件后端、测试数据库替代口径、E2E 深度、视觉细节
UCloud 部署验收2018UCloud CLI 创建、资源记录、SSH、防火墙、Docker、公网验收和清理说明完成;扣分点是第一次交付没有独立实现部署断点重启/重启恢复能力

主要扣分点:后端核心逻辑集中在单文件、E2E 关键风险断言偏浅、删除动画未真正实现、中屏紧凑样式缺失、长标题溢出、部署断点重启需要人工介入。 B.2 Claude Opus 4.8

指标结果
综合分186/200
质量分15/20
最终时长1h28m09s
实际费用¥808.18
Token 总数19.82M
对话消息总次数171
人工介入次数0
阶段展示满分得分得分备注
需求理解2020方案完整识别实体、字段、权限、状态机、筛选/日历细节
功能设计202012 个接口、E2E-0115、UT-0121 均在方案中完整设计
架构设计2018架构和部署拆分完整;固定安全组不放行 80/3000,实际靠额外防火墙修正
前端实现2016主流程完整;扣 readonly 状态推进按钮仍可见、严格三断点不足、动画偏差和长标题溢出
后端实现2019权限/状态机/认证/种子/接口完整;扣缺少 year/month 日历查询接口参数
功能测试2020UT 21/21,E2E 15/15,当前云端复跑 E2E 15/15
问题处理2020部署中定位并解决 ubuntu 登录、防火墙、Docker Hub 拉取慢等问题
代码质量检查2018SQL 参数化、bcrypt、统一响应较好;扣前后端权限收敛一致性和少量实现细节
UCloud 部署验收2020UHost/EIP/公网 IP/防火墙/公网验收/E2E 均完成,能处理 ubuntu 登录和防火墙问题

主要扣分点:readonly 用户前端仍显示状态推进按钮、后端缺少 year/month 查询参数、响应式断点不严格、动画实现偏离需求、长标题溢出。

B.3 GLM 5.1

指标结果
综合分151/200
质量分10/20
最终时长1h31m45s
实际费用¥63.71
Token 总数21.38M
对话消息总次数167
人工介入次数2
阶段展示满分得分得分备注
需求理解2020Plan 文档完整覆盖字段、权限、状态机、筛选/日历
功能设计2020API/E2E/UT 设计完整
架构设计2018后端分层完整;部署 SSH 用户口径有风险
前端实现2014功能组件较全;首次进入项目任务不加载、样式丢失、登录态问题扣分
后端实现2019后端结构和约束较完整
功能测试2016E2E 文件覆盖 15 项;未挡住首屏任务加载和样式问题
问题处理2010bash tool schema 错误和前端样式问题需人工介入
代码质量检查2013结构较好,但前端 effect 依赖和部署脚本问题明显
UCloud 部署验收2011有公网 IP 记录,但 SSH 用户口径、部署脚本、前端样式和页面加载问题影响验收

主要扣分点:首次进入项目页任务不会加载、前端样式丢失、刷新页面登录信息未保存、部署脚本 root 登录和校验命令风险。

B.4 Qwen3.7 Max

指标结果
综合分148/200
质量分10/20
最终时长1h54m34s
实际费用¥148.27
Token 总数24.93M
对话消息总次数210
人工介入次数2
阶段展示满分得分得分备注
需求理解2017核心需求覆盖;ER 图 Mermaid 解析失败扣分
功能设计2018API/E2E/UT 设计较完整
架构设计2016分层较好;部署与前后端接口一致性有风险
前端实现2014主要功能存在;状态流转接口和邀请功能在实际测评中失败
后端实现2018状态机和权限基本实现;接口方法与前端部署后调用不一致
功能测试2016UT/E2E 文件完整,但未挡住 405 和邀请缺失问题
问题处理2013有人工介入,最终问题记录明确
代码质量检查2013结构尚可,但接口一致性和页面检查不足
UCloud 部署验收2013有公网访问记录,但状态流转 405、邀请功能缺失,Docker 重启策略和部署一致性不足

主要扣分点:Mermaid ER 图解析失败、状态流转接口 405、前端页面缺少邀请功能、测试没有提前发现部署后的使用问题。

B.5 Deepseek V4 Pro

指标结果
综合分146/200
质量分9/20
最终时长2h43m43s
实际费用¥39.70
Token 总数49.23M
对话消息总次数259
人工介入次数4
阶段展示满分得分得分备注
需求理解2018核心需求完整;API 前缀口径略不清
功能设计2018API/E2E/UT 设计完整;日历查询设计偏弱
架构设计2018前后端分层较好,Docker restart 较完整
前端实现2013多个核心前端 Bug:登录路径、assignee 类型、重新打开状态、成员管理
后端实现2018后端功能较完整,状态机能拦截非法流转
功能测试2016测试文件较全,但没有提前发现部署后的前端 Bug
问题处理2010多次人工介入,断点重启需用户介入
代码质量检查2013结构好,但前后端接口约定和部署流程质量不足
UCloud 部署验收2013公网可测,Docker restart 较完整,但登录、任务编辑和重新打开等核心交互出错,断点重启需人工介入

主要扣分点:assignee_id 提交字符串导致 422、登录接口 /api/login 404、重新打开功能目标状态错误、前端缺少成员管理组件、部署断点重启需人工介入。 B.6 Kimi K2.6

指标 结果 综合分 136/200 质量分 8/20 最终时长 3h43m37s 实际费用 ¥42.45 Token 总数 23.76M 对话消息总次数 291 人工介入次数 3 阶段 展示满分 得分 得分备注 需求理解 20 17 基本覆盖核心需求;扣部分约束表达不完整,部署登录方式仍写 root 功能设计 20 18 API/E2E/UT 设计完整,但 UCloud SSH 设计有明显风险 架构设计 20 16 前后端和后端分层较完整;部署架构和资源记录混乱扣分 前端实现 20 16 看板/日历/邀请/筛选基本实现;筛选类型、响应式/动画细节有偏差 后端实现 20 18 FastAPI、权限、状态机、种子数据基本完整 功能测试 20 16 有 UT/E2E 设计和测试文件;未见充分当前复跑证据,部署重启问题未覆盖 问题处理 20 10 多次人工介入;SSH、防火墙、资源选择问题未能独立闭环 代码质量检查 20 10 功能代码尚可,但部署脚本存在 root 登录、安全边界和资源治理问题 UCloud 部署验收 20 7 有公网 IP/UHost 记录,但 SSH、防火墙、资源使用和重启自恢复问题严重

主要扣分点:SSH 登录阻塞、创建资源失败后未提示用户就改用其他服务器、有安全风险、默认未配置 UCloud 防火墙、服务器关机开机后 Docker 未自启动。 附录 C:细项评分矩阵 下面矩阵用于回答“每个阶段具体扣在哪里”。所有细项和小计均采用 20 分制,细项含义见附录 A。 C.1 需求、设计与架构细项

细项 满分 GLM 5.2 ChatGPT 5.5 Claude Opus 4.8 GLM 5.1 Qwen3.7 Max Deepseek V4 Pro Kimi K2.6 RU-01 实体与关系识别 5 5 5 5 5 2 5 5 RU-02 字段类型与约束还原 5 5 5 5 5 5 5 3 RU-03 权限模型理解 4 4 4 4 4 4 2 3 RU-04 状态机理解 4 4 4 4 4 4 4 4 RU-05 筛选与日历理解 2 2 2 2 2 2 2 2 RU 小计 20 20 20 20 20 17 18 17 FD-01 API 设计 8 8 8 8 8 6 6 8 FD-02 E2E 设计 6 6 6 6 6 6 6 6 FD-03 UT 设计 6 6 6 6 6 6 6 4 FD 小计 20 20 20 20 20 18 18 18 AD-01 技术栈选型 4 4 4 4 4 4 4 4 AD-02 DDL 与数据约束 5 5 5 5 5 3 5 3 AD-03 分层与权限架构 4 4 2 4 4 4 4 4 AD-04 部署架构 4 2 4 4 2 2 2 2 AD-05 阶段拆分和交付物 3 3 1 1 3 3 3 3 AD 小计 20 18 16 18 18 16 18 16

C.2 前端、后端与测试细项

细项满分GLM 5.2ChatGPT 5.5Claude Opus 4.8GLM 5.1Qwen3.7 MaxDeepseek V4 ProKimi K2.6
FE-01 基础页面与导航32331313
FE-02 看板与任务卡44443334
FE-03 任务与成员操作33333023
FE-04 筛选与日历33332321
FE-05 权限入口收敛33313223
FE-06 动画与交互反馈21111111
FE-07 加载、空状态、错误提示11110111
FE-08 响应式适配10001110
FE 小计2017181614141316
BE-01 核心接口完整性44444334
BE-02 状态流转校验44444444
BE-03 权限校验44444444
BE-04 鉴权机制33333333
BE-05 字段约束落地22222211
BE-06 初始化与种子数据22222121
BE-07 查询与日历支持11100111
BE 小计2020201919181818
TS-01 E2E 工具和可运行性44444444
TS-02 E2E 覆盖和通过率43442222
TS-03 readonly/权限 E2E33233222
TS-04 独立测试数据库33332333
TS-05 UT 覆盖完整性33333333
TS-06 风险点单测33332222
TS 小计2019192016161616

C.3 问题处理、代码质量与部署细项

细项满分GLM 5.2ChatGPT 5.5Claude Opus 4.8GLM 5.1Qwen3.7 MaxDeepseek V4 ProKimi K2.6
PD-01 问题识别88881411
PD-02 修复闭环88885555
PD-03 验证记录44444444
PD 小计2020202010131010
CR-01 代码结构与可维护性88585663
CR-02 安全与错误处理75575222
CR-03 接口约定一致性与细节质量55533555
CR 小计2018151813131310
DP-01 UCloud CLI 创建资源22222221
DP-02 资源信息记录22222222
DP-03 SSH 登录和服务器连接33330210
DP-04 防火墙和公网端口44442330
DP-05 Docker Compose 部署33332022
DP-06 公网功能验收3333222
模型质量分P1/P2/P3 摘要
GLM 5.217/20无 P1/P2;P3 为首页缺少注册入口、长标题溢出、删除动画证据偏弱和敏感部署元数据治理
ChatGPT 5.516/20无 P1;P2 为架构落地偏离和 E2E 关键风险断言偏浅;P3 为删除动画、中屏样式、长标题溢出、测试数据库同构性
Claude Opus 4.815/20无 P1;P2 为 readonly 前端写入口、year/month 查询缺口;P3 为响应式、动画、长标题溢出、E2E 响应式断言浅
GLM 5.110/20多个 P2:首次项目页任务不加载、前端样式丢失、刷新登录态失败;P3 为部署脚本风险
Qwen3.7 Max10/20P2:状态流转接口 405、邀请功能部署验收缺失;需求阶段 ER 图解析失败
Deepseek V4 Pro9/20多个 P2:assignee 类型 422、登录 404、重新打开状态错误、成员管理缺失、断点重启人工介入
Kimi K2.68/20部署安全/治理风险突出:SSH 阻塞、抢用其它服务器、防火墙缺失、Docker 重启后不自启动

附录 D:小项扣分明细
本附录只列没有拿满分的小项。所有“满分、得分、扣分”均采用 20 分制细项分;未列出的小项表示本轮证据支持满分。详细依据可继续查看各模型的 auditable-score.md。
D.0 GLM 5.2

小项满分得分扣分扣分依据
AD-04 部署架构422Plan 和 README 多处写 ssh root@<IP>;实际 session 中用户提示后改用 ubuntu 才完成 SSH。
FE-01 基础页面与导航321首页页面只有登录按钮,无法直接切换到注册页面;实际 /register 页面存在且可正常注册。
FE-06 动画与交互反馈211前端实现了 FAB、弹窗、Toast、任务进入动画,但删除流程主要是确认弹窗,未充分证明“任务卡 scale 1→0.8 + opacity 1→0”的删除动画闭环。
FE-08 响应式适配101人工验收发现长文本标题溢出容器,文本保护不足。
TS-02 E2E 覆盖和通过率431E2E 本地和云端均 15/15 通过,但部分用例只断言页面可见或列存在,例如成员筛选、状态筛选、响应式断言偏浅。
CR-02 安全与错误处理752deploy-meta.json 记录了 SSH 密码字段;虽然便于部署追踪,但作为项目产物存在敏感信息治理风险。

D.1 ChatGPT 5.5

小项满分得分扣分扣分依据
AD-03 分层与权限架构422Plan 设计 routes/、repositories/、permissions.py 等分层,但实际核心路由、权限和 SQL 大量集中在 backend/app/main.py。
AD-05 阶段拆分和交付物312Plan 前端建议拆分 API/state/components/styles/e2e 多目录,但实际前端核心业务集中在 frontend/src/App.jsx。
FE-06 动画与交互反馈211删除只用 window.confirm 后直接刷新,没有实现要求的 scale/opacity 删除确认动画。
FE-08 响应式适配101768-1023 中屏没有单独实现“三列并排、卡片信息紧凑显示”的样式。
TS-03 readonly/权限 E2E321readonly E2E 只断言邀请按钮隐藏,没有覆盖创建、编辑、删除、状态推进全部写入口。
CR-01 代码结构与可维护性853后端核心业务集中在单文件,和 Plan 的 repository/route/permission 分层不一致。
CR-02 安全与错误处理752测试环境用 SQLite 替代 PostgreSQL,和“生产与测试同结构/独立数据库”口径不完全一致。
DP-07 重启恢复能力202人工记录显示“部署支持断点重启”需要人工介入。按“第一次没实现就是 0 分”的口径,该项不得分。

D.2 Claude Opus 4.8

小项满分得分扣分扣分依据
AD-05 阶段拆分和交付物312部署架构整体完整,但最初固定安全组不放行 80/3000,实际靠额外防火墙修正,存在方案/执行偏差。
FE-05 权限入口收敛312readonly 用户隐藏了邀请、添加、编辑、删除,但状态推进按钮仍无条件显示。
FE-06 动画与交互反馈211任务切列动画方向/距离不符合需求,删除动画定义后未实际套到任务卡删除流程。
FE-08 响应式适配101未严格区分 768-1023 和 >=1024 两个并排断点,也没有卡片紧凑模式。
BE-07 查询与日历支持101后端缺少明确的 year/month 日历查询接口参数,只能通过其它查询方式间接满足。
CR-03 接口约定一致性与细节质量532readonly 前端仍展示状态推进写入口,日历查询参数缺口和响应式测试偏浅。

D.3 GLM 5.1

小项满分得分扣分扣分依据
AD-04 部署架构422Plan 和部署脚本偏向 ssh root@<IP>,对本轮 UCloud Ubuntu 镜像不稳。
FE-01 基础页面与导航312人工记录显示前端样式丢失,基础页面可用性和视觉验收受影响。
FE-02 看板与任务卡431首次进入项目页任务不会加载,影响看板首屏任务展示。
FE-04 筛选与日历321首次进入项目任务不加载会连带影响筛选/日历首屏数据展示。
FE-06 动画与交互反馈211前端样式丢失后,交互反馈和动画验收不可靠。
FE-07 加载、空状态、错误提示101首次进入项目页任务不加载,缺少足够清晰的加载/错误闭环。
BE-07 查询与日历支持101后端日历查询支持证据不足,测试未能挡住首屏任务加载问题。
TS-02 E2E 覆盖和通过率422E2E 文件覆盖 15 项,但没有发现样式丢失和首次项目页任务不加载。
TS-04 独立测试数据库321独立测试数据库和生产同构性证据不足。
TS-06 风险点单测321测试未覆盖前端首屏任务加载、刷新登录态和样式部署风险。
PD-01 问题识别817bash tool schema 错误、前端样式丢失等问题需要人工指出或推动。
PD-02 修复闭环853前端样式和页面加载问题没有形成模型独立修复闭环。
CR-01 代码结构与可维护性853前端 effect 依赖缺陷导致首次进入项目任务不会加载。
CR-02 安全与错误处理752部署脚本 root 登录和校验命令存在风险。
CR-03 接口约定一致性与细节质量532前端样式、登录态和首屏数据加载问题影响整体交付细节。
DP-03 SSH 登录和服务器连接303SSH 用户口径有风险,脚本偏向 root 登录。
DP-04 防火墙和公网端口422公网部署验收受前端样式和页面加载问题影响,防火墙/公网端口闭环证据不足。
DP-05 Docker Compose 部署321部署脚本和校验命令存在风险,Docker 部署链路不够稳。
DP-06 公网功能验收321前端样式丢失、首次项目页任务不加载,公网功能验收不完整。
DP-07 重启恢复能力202重启恢复能力证据不足,且未证明服务器重启后业务服务能自动恢复。

D.4 Qwen3.7 Max

小项满分得分扣分扣分依据
RU-01 实体与关系识别523Mermaid ER 图因 UNIQUE(project_id, user_id) 写法解析失败,影响需求文档实体关系可读性。
FD-01 API 设计862状态流转接口设计和部署后前端实际调用不一致,出现 405。
AD-02 DDL 与数据约束532ER/DDL 表达存在 Mermaid 解析失败问题,数据约束文档可审计性不足。
AD-04 部署架构422Docker Compose 缺少 restart 策略,部署稳定性不如其它模型。
FE-02 看板与任务卡431状态流转接口 405,任务状态修改主流程失败。
FE-03 任务与成员操作303人工测评记录前端页面缺少用户邀请功能,无法邀请其他用户加入项目。
FE-05 权限入口收敛321邀请功能实际不可用,权限相关入口和验收不完整。
FE-06 动画与交互反馈211核心状态修改失败,交互反馈验收不完整。
BE-01 核心接口完整性431部署后状态流转接口返回 405,接口方法或路径不一致。
BE-06 初始化与种子数据211公网核心功能验收失败,种子数据和成员协作链路验证不完整。
TS-02 E2E 覆盖和通过率422测试没有发现部署后的状态流转 405。
TS-03 readonly/权限 E2E321邀请/成员相关权限功能缺失,权限 E2E 验收不足。
TS-06 风险点单测321测试未挡住接口方法不一致和邀请功能缺失。
PD-01 问题识别844ER 图解析错误、状态流转 405 需要人工介入暴露。
PD-02 修复闭环853状态流转 405 和邀请缺失没有形成独立闭环。
CR-01 代码结构与可维护性862部署产物与源码/接口设计存在不一致风险。
CR-02 安全与错误处理725接口方法错误和关键功能缺失说明错误处理及验收不足。
DP-03 SSH 登录和服务器连接321部署能推进,但人工介入后才暴露/处理部分问题。
DP-04 防火墙和公网端口431公网能访问,但核心状态流转接口不可用,端到端验收不足。
DP-05 Docker Compose 部署303Compose 缺少 restart 策略,部署产物与接口行为不一致。
DP-06 公网功能验收321状态流转 405、邀请功能缺失,公网验收不完整。
DP-07 重启恢复能力211重启恢复能力证据不足,只能给部分分。

D.5 Deepseek V4 Pro

D.6 Kimi K2.6

小项满分得分扣分扣分依据
RU-03 权限模型理解422API 前缀和登录路径口径略不清,和后续 /api/login 404 有<span>关联风险</span>
FD-01 API 设计862API 前缀/登录路径设计不够稳定,部署后出现 /api/login 404。
AD-04 部署架构422部署断点重启需要人工介入,部署架构闭环不足。
FE-01 基础页面与导航312登录接口 /api/login 404,登录主流程在实际访问中失败过。
FE-02 看板与任务卡431“重新打开”目标状态错误,请求 done -> todo 被后端拒绝。
FE-03 任务与成员操作321前端缺少成员管理组件/入口,任务编辑 assignee 类型也出错。
FE-04 筛选与日历321assignee 字段类型前后端不一致,成员相关筛选/编辑可靠性不足。
FE-05 权限入口收敛321成员管理入口缺失,权限相关前端能力不完整。
FE-06 动画与交互反馈211多个核心交互报错,反馈和交互闭环不足。
BE-01 核心接口完整性431前端请求 /api/login 404,登录路径和部署代理口径不一致。
BE-05 字段约束落地211assignee_id 前端提交字符串导致后端 422,前后端字段类型约定不一致。
TS-02 E2E 覆盖和通过率422测试未发现登录 404、assignee 类型错误和重新打开状态错误。
TS-03 readonly/权限 E2E321成员管理/权限入口实际缺失,权限 E2E 覆盖不足。
TS-06 风险点单测321测试未挡住状态目标错误和前后端字段类型错误。
PD-01 问题识别817422、404、重新打开状态错误、断点重启均由人工介入暴露。
PD-02 修复闭环853多个核心问题没有模型独立闭环,断点重启也需人工介入。
CR-01 代码结构与可维护性862虽然模块化较好,但前后端路径和字段约定维护质量不足。
CR-02 安全与错误处理725登录 404、任务编辑 422 等错误在交付前未被拦截。
DP-03 SSH 登录和服务器连接312部署支持断点重启需要人工介入,连接/恢复闭环不足。
DP-04 防火墙和公网端口431公网可测,但登录、任务编辑、重新打开等核心交互出错。
DP-05 Docker Compose 部署321Docker restart 较完整,但部署后核心交互仍暴露问题。
DP-06 公网功能验收321公网验收暴露登录 404、任务编辑 422、状态错误。
DP-07 重启恢复能力202部署断点重启需人工介入,不能计入模型独立完成。

附录 E:问题数量明细
本附录补充说明主表中的 人工验收问题数开发自修 Bug 数
E.1 人工验收问题数
人工验收问题数只统计交付后由人工验收、人工记录或用户测评过程中明确指出的问题;模型在开发过程中自己发现并修掉的问题不放在这里。

小项满分得分扣分扣分依据
RU-02 字段类型与约束还原532描述字段在 DDL 中写为 TEXT,没有体现 500 字符限制。
RU-03 权限模型理解431部署登录方式仍写 root,说明对 UCloud 部署约束理解不完整。
FD-03 UT 设计642UT 设计存在,但部署重启恢复风险没有纳入测试闭环。
AD-02 DDL 与数据约束532描述长度等约束没有在 DDL 层充分体现。
AD-04 部署架构422部署架构没有识别 Ubuntu 镜像 root SSH 风险。
FE-04 筛选与日历312成员筛选存在字符串和 UUID/ID 类型不一致风险。
FE-06 动画与交互反馈211响应式/动画细节有偏差,交互验收不完整。
FE-08 响应式适配101长标题可能溢出,响应式/文本保护不足。
BE-05 字段约束落地211描述长度和前端筛选类型问题说明字段约束落地不充分。
BE-06 初始化与种子数据211部署资源混乱和重启问题影响种子数据/服务恢复验收。
TS-02 E2E 覆盖和通过率422未见充分当前复跑证据,部署重启问题未覆盖。
TS-03 readonly/权限 E2E321权限相关 E2E 覆盖证据不足。
TS-06 风险点单测321测试未覆盖 Docker 自启动、防火墙、SSH 等部署风险。
PD-01 问题识别817SSH 登录阻塞、创建资源失败、防火墙未配置均需人工介入。
PD-02 修复闭环853SSH、防火墙、资源选择问题未能独立闭环。
CR-01 代码结构与可维护性835部署状态分散在多套资源文件,资源治理混乱。
CR-02 安全与错误处理725创建资源失败后未提示用户就改用其他服务器,有安全和评测污染风险。
DP-01 UCloud CLI 创建资源211创建资源失败,后续改用其它服务器部署。
DP-03 SSH 登录和服务器连接303SSH 登录阻塞,需要用户确认修复方案后继续。
DP-04 防火墙和公网端口404默认未配置 UCloud 防火墙,导致公网访问不了。
DP-05 Docker Compose 部署321Docker 部署可推进,但服务器关机开机后 Docker 未自启动。
DP-06 公网功能验收321防火墙缺失和资源混乱影响公网验收完整性。
DP-07 重启恢复能力202服务器关机开机后 Docker 没有自启动。
DP-08 调试和清理说明101创建资源失败后改用其它服务器且资源记录混乱,调试和清理说明不足以避免资源残留或误删。

模型 人工验收问题数 计入的问题 GLM 5.2 2 长文本标题溢出容器;首页只有登录按钮,缺少注册入口 Claude Opus 4.8 1 长标题溢出容器 ChatGPT 5.5 2 部署断点重启需要人工介入;长标题溢出容器 GLM 5.1 3 前端样式丢失;刷新页面登录信息未保存;首次进入项目页任务数据不加载 Qwen3.7 Max 3 ER 图解析失败;状态流转接口 405;缺少用户邀请功能 Deepseek V4 Pro 5 assignee_id 类型错误导致 422;/api/login 404;重新打开任务目标状态错误;缺少成员管理组件;部署断点重启需要人工介入 Kimi K2.6 4 SSH 登录阻塞;创建资源失败后未提示用户就使用其它服务器;默认未配置 UCloud 防火墙;服务器关机开机后 Docker 未自启动

E.2 人工验收问题逐项明细

模型 序号 问题 类型 GLM 5.2 1 页面标题太长时溢出容器 前端显示 GLM 5.2 2 首页页面只有登录按钮,无法直接切换到注册页面;实际 /register 页面存在且可正常注册 前端入口/导航 Claude Opus 4.8 1 页面标题太长时溢出容器 前端显示 ChatGPT 5.5 1 部署过程需要人工介入处理断点重启 部署 ChatGPT 5.5 2 页面标题太长时溢出容器 前端显示 GLM 5.1 1 前端样式丢失 前端显示 GLM 5.1 2 刷新页面后登录信息没有保存 前端状态 GLM 5.1 3 首次进入项目页面时任务数据不会加载 前端数据加载 Qwen3.7 Max 1 需求/设计文档中的 Mermaid ER 图解析失败 需求/设计文档 Qwen3.7 Max 2 修改任务状态时报 POST /api/tasks/1/transition 405 Method Not Allowed 核心功能/API Qwen3.7 Max 3 前端页面缺少用户邀请功能,无法邀请其他用户加入项目 前端功能 Deepseek V4 Pro 1 修改任务时 assignee_id 提交字符串,后端返回 422 前后端字段约定 Deepseek V4 Pro 2 登录请求 /api/login 返回 404 Not Found 登录/API Deepseek V4 Pro 3 “重新打开”任务时目标状态不对,后端拒绝 done -> todo 状态机 Deepseek V4 Pro 4 前端缺少成员管理组件 前端功能 Deepseek V4 Pro 5 部署过程需要人工介入处理断点重启 部署 Kimi K2.6 1 SSH 登录阻塞,需要用户确认修复方案后继续部署 部署/连接 Kimi K2.6 2 创建资源失败后未提示用户就使用其它服务器部署 部署/资源治理 Kimi K2.6 3 默认未配置 UCloud 防火墙,导致公网访问不了 部署/网络 Kimi K2.6 4 服务器关机开机后 Docker 没有自启动 部署/重启恢复

E.3 开发自修 Bug 数 开发自修 Bug 数只统计模型在正式 FT session 中自己遇到失败、报错、测试不通过或部署异常后,自己定位、修改并复测的闭环事件。同一根因的多次重试只算 1 个;人工验收发现的问题不计入这里。

模型 开发自修 Bug 数 计入口径和主要依据 GLM 5.2 14 前端 import/TypeScript;PostgreSQL 旧 volume;鉴权 500;单测 token 假设;pytest marker;E2E 导入/rootdir/跳转;SSH 用户和密码;Docker 安装;Docker Hub/PyPI/apt 网络;UCloud 防火墙公网访问问题 Claude Opus 4.8 10 DB healthcheck/stale volume;pytest-playwright fixture 冲突;Chrome 启动兼容;E2E 状态切换等待;E2E toast 干扰;邀请成员刷新等待;删除后计数等待;SSH 默认用户识别;Docker 安装脚本/远端命令问题;Docker Hub 镜像和 UCloud 防火墙访问问题 ChatGPT 5.5 8 前端 JSX 构建失败;本地端口冲突;后端健康检查失败/旧 volume;E2E fixture 冲突;Playwright URL 断言写法;请求封装 Content-Type 导致 422;SSH/expect 登录脚本问题;rsync/scp 与 Docker Hub 镜像超时问题 GLM 5.1 8 API {success,data} 解包和导入问题;模态框枚举值/API 使用问题;nginx.conf Docker 构建路径;后端 HTTPException 导入;数据库启动顺序/健康检查;“重新打开”目标状态错误;SSH 登录用户/密码问题;公网 80/3000 访问和防火墙问题 Qwen3.7 Max 7 Docker Compose/healthcheck 校验;本地 5432 端口冲突;数据库认证/旧 volume;psycopg2.pool 缺失;FastAPI trailing slash 307;SSH 密码和 known_hosts 问题;Docker 安装、rsync/nginx 部署问题。用户人工指出的状态流转 405 不计入开发自修 Bug Deepseek V4 Pro 18 后端重复模块/导入和响应封装冲突;本地 DB 端口冲突;dotenv/test DB 配置;Starlette/httpx 依赖冲突;测试用户隔离;sample_tasks 状态准备错误;本地后端端口冲突;SSH 认证;安全组权限;Docker 安装/apt 源;tar 打包语法;requirements/pip/npm 镜像;远端 .env 重复值;旧 Dockerfile/旧代码未覆盖;nginx.conf 构建上下文;npm ci 缺 package-lock;后端 main.py 导入路径;UCloud 防火墙公网访问。用户人工指出的 422、404、重新打开状态错误不计入开发自修 Bug Kimi K2.6 12 UHostId JSON 数组提取;known_hosts 旧 key;SSH/root/password/keypair 登录阻塞;FastAPI Depends 异步依赖写法;前端 import 路径;后端模块路径/PYTHONPATH;rsync 权限;Docker Compose 构建超时/SSH 不稳定;Docker 安装脚本失败改用 snap;snap Docker 工作目录限制;Docker Hub 拉取超时;后端 Dockerfile apt/pip 镜像和上传重试。用户人工指出的刷新登录态、首次项目任务不加载不计入开发自修 Bug

E.4 开发自修 Bug 逐项明细

模型序号自修 Bug / 异常归类
GLM 5.21前端 import 路径错误导致构建失败,修正 auth 页面 import前端构建
GLM 5.22import.meta.env / Vite 类型问题,补充类型声明前端构建
GLM 5.23PostgreSQL 旧 volume 导致密码认证失败,清理并改唯一 volume 名称数据库/Docker
GLM 5.24/api/users 无 token 返回 500,重构 auth dependency 后返回 401后端鉴权
GLM 5.25单测中 register 后错误读取 token,改为注册后登录获取 token测试
GLM 5.26pytest marker 配置缺失或不稳,补充 pytest 配置测试配置
GLM 5.27E2E 相对导入失败,调整导入方式E2E
GLM 5.28E2E rootdir/timeout 参数问题,调整运行方式E2E
GLM 5.29注册后未自动跳转首页导致 E2E 失败,修正登录/注册路由跳转前端路由
GLM 5.210UCloud SSH 密码登录失败,停止/重置/启动并切换 ubuntu 用户完成连接部署/SSH
GLM 5.211远端服务器无 Docker,安装 Docker Engine 和 Compose plugin部署/Docker
GLM 5.212Docker Hub 拉取超时,配置镜像加速和后台构建部署/网络
GLM 5.213Debian apt 源下载极慢,优化 Dockerfile 去掉 apt 编译依赖部署/构建
GLM 5.214PyPI 访问失败,改用国内 pip 源;公网 80/3000 超时后配置 UCloud 防火墙部署/网络
Claude Opus 4.81数据库 healthcheck 或旧 volume 导致服务状态异常,清理后复测后端/数据库
Claude Opus 4.82pytest-playwright fixture 冲突,调整测试配置后复测测试
Claude Opus 4.83Chrome/Playwright 启动兼容问题,调整启动方式后复测测试
Claude Opus 4.84E2E 状态切换等待不稳定,补充等待逻辑后复测测试
Claude Opus 4.85E2E toast 干扰点击或断言,调整选择器/等待后复测测试
Claude Opus 4.86邀请成员后刷新等待不稳定,调整流程后复测前端/E2E
Claude Opus 4.87删除任务后计数等待不稳定,调整断言后复测前端/E2E
Claude Opus 4.88SSH 默认用户识别错误,切换正确用户后继续部署部署/SSH
Claude Opus 4.89Docker 安装脚本或远端命令问题,修正后继续部署部署/Docker
Claude Opus 4.810Docker Hub 镜像拉取和 UCloud 防火墙访问问题,处理后完成公网验收部署/网络
ChatGPT 5.51前端 JSX 构建失败,修正代码后重新构建前端构建
ChatGPT 5.52本地端口冲突,调整进程/端口后继续测试本地环境
ChatGPT 5.53后端健康检查失败或旧 volume 影响启动,清理后复测后端/数据库
ChatGPT 5.54E2E fixture 冲突,调整测试配置后复跑测试
ChatGPT 5.55Playwright URL 断言写法不稳定,修正断言后复跑测试
ChatGPT 5.56请求封装 Content-Type 导致 422,修正请求逻辑后复测前后端接口
ChatGPT 5.57SSH/expect 登录脚本问题,调整脚本后继续部署部署/SSH
ChatGPT 5.58rsync/scp 与 Docker Hub 镜像超时,调整上传/拉取方式后继续部署部署/网络
GLM 5.11API {success,data} 解包和导入问题,修正后复测前后端接口
GLM 5.12模态框枚举值或 API 使用问题,修正后复测前端/API
GLM 5.13nginx.conf Docker 构建路径错误,调整构建上下文后复测部署/前端
GLM 5.14后端 HTTPException 导入缺失,补充导入后复测后端
GLM 5.15数据库启动顺序或健康检查问题,调整依赖后复测后端/数据库
GLM 5.16"重新打开"任务目标状态错误,调整状态转换后复测状态机
GLM 5.17SSH 登录用户或密码问题,调整登录方式后继续部署部署/SSH
GLM 5.18公网 80/3000 访问和防火墙问题,调整网络配置后复测部署/网络
Qwen3.7 Max1Docker Compose healthcheck 校验问题,调整配置后复测部署/Docker
Qwen3.7 Max2本地 5432 端口冲突,调整本地数据库/端口后继续测试本地环境
Qwen3.7 Max3数据库认证或旧 volume 问题,清理/修正后复测后端/数据库
Qwen3.7 Max4psycopg2.pool 缺失,补充依赖或调整实现后复测后端依赖
Qwen3.7 Max5FastAPI trailing slash 307 问题,调整路由或请求后复测后端/API
Qwen3.7 Max6SSH 密码和 known_hosts 问题,处理后继续部署部署/SSH
Qwen3.7 Max7Docker 安装、rsync/nginx 部署问题,调整后继续公网部署部署
Deepseek V4 Pro1后端重复模块、导入和响应封装冲突,整理后复测后端结构
Deepseek V4 Pro2本地数据库端口冲突,调整后继续测试本地环境
Deepseek V4 Pro3dotenv/test DB 配置问题,修正测试环境后复测测试/配置
Deepseek V4 Pro4Starlette/httpx 依赖冲突,调整依赖后复测后端依赖
Deepseek V4 Pro5测试用户隔离问题,调整测试数据后复测测试
Deepseek V4 Pro6sample_tasks 状态准备错误,修正 fixture 后复测测试/状态机
Deepseek V4 Pro7本地后端端口冲突,调整进程/端口后继续测试本地环境
Deepseek V4 Pro8SSH 认证问题,调整连接方式后继续部署部署/SSH
Deepseek V4 Pro9安全组权限问题,调整 UCloud 网络规则后复测部署/网络
Deepseek V4 Pro10Docker 安装或 apt 源问题,调整安装方式后继续部署部署/Docker
Deepseek V4 Pro11tar 打包语法问题,修正打包命令后继续上传部署/打包
Deepseek V4 Pro12requirements/pip/npm 镜像问题,调整镜像源后继续构建构建/依赖
Deepseek V4 Pro13远端 .env 重复值问题,清理配置后复测部署/配置
Deepseek V4 Pro14旧 Dockerfile 或旧代码未覆盖,重新同步后复测部署/构建
Deepseek V4 Pro15nginx.conf 构建上下文问题,调整 Docker 构建后复测前端部署
Deepseek V4 Pro16npm ci 缺少 package-lock,调整安装命令后继续构建前端构建
Deepseek V4 Pro17后端 main.py 导入路径问题,修正后复测后端启动
Deepseek V4 Pro18UCloud 防火墙公网访问问题,调整规则后复测部署/网络
Kimi K2.61UHostId JSON 数组提取错误,修正解析后继续创建/查询资源UCloud CLI
Kimi K2.62known_hosts 旧 key 冲突,清理后继续 SSH部署/SSH
Kimi K2.63SSH/root/password/keypair 登录阻塞,多次调整登录方式后继续部署/SSH
Kimi K2.64FastAPI Depends 异步依赖写法问题,修正后复测后端
Kimi K2.65前端 import 路径错误,修正后重新构建前端构建
Kimi K2.66后端模块路径或 PYTHONPATH 问题,调整后复测后端启动
Kimi K2.67rsync 权限问题,调整上传方式后继续部署部署/上传
Kimi K2.68Docker Compose 构建超时或 SSH 不稳定,调整后继续部署部署/Docker
Kimi K2.69Docker 安装脚本失败后改用 snap Docker部署/Docker
Kimi K2.610snap Docker 工作目录限制,调整目录/权限后继续部署/Docker
Kimi K2.611Docker Hub 拉取超时,调整镜像拉取/重试后继续部署/网络
Kimi K2.612后端 Dockerfile apt/pip 镜像和上传重试问题,调整后继续部署部署/构建