模型评测应绑定真实仓库任务与可量化通过率,而不是单次炫技 Demo。

适用场景

评估 DeepSeek V4(Pro/Flash)是否适合作为 Claude Code 的日常或备用模型,覆盖代码审计、Schema 迁移、依赖升级等后端常见活。

方法与要点

配置文件法集中管理 base URL、模型名与 API Key。建立基准任务集:静态审计(安全/并发)、迁移脚本、重构单模块。Flash 适合快迭代与草稿,Pro 适合跨文件推理。记录 token、轮次、测试通过率,而非主观「感觉」。

工作流

每个场景固定输入仓库快照与验收测试;先 Pro 出方案,Flash 执行机械改动;失败样本入库作为回归集。切换模型后会话规则与 Skills 保持不变,只变推理后端。

风险

低价模型在隐蔽 bug 上漏报;迁移脚本未处理 charset/索引差异;评测样本过少导致过拟合工具链。

检查清单

  • 基准任务 ≥5 类且可自动验
  • 密钥不进 Git
  • 记录每任务成本
  • 失败 diff 人工二次审
  • 生产路径仍保留旗舰模型兜底

落地建议

把「DeepSeek V4 + Claude Code 实战」相关的动作写进团队 Wiki 或 CLAUDE.md,并在两次 Sprint 里刻意练习:一次只用 IDE 路径,一次只用 CLI 路径,对比 PR 大小、缺陷率与 review 耗时。记录哪些步骤必须人工签核、哪些可以交给 Agent 自治,比争论工具优劣更能沉淀可复用经验。