DeepSeek-V4.1-Flash 的最佳 Harness 搭档,我觉得可能是 Claude Code

在最新的测试中,DeepSeek-V4.1-Flash开源后,其本地部署成本显著降低。官方测试显示,DSH Minimal模式在功能和流程上超越Standard与PTC模式,尽管反常识地优于后者,但并未带来更高的成功率。Claude Code或Codex里接入DeepSeek-V4.1-Flash后,其开箱即用的水平接近峰值。Pi Agent、DeepSeek Harness桌面端以及Claude Code的表现各异,其中Claude Code在太空水滴设计上表现出色,而DSH标准模式在任务执行效率上领先。综合评分显示,Claude Code在交付质量、代码准确率和工程完整性方面均位列第一,是最适合生产级工业落地的方案。

--91likeyou---

2、Claude Code 或 Codex 里接 DeepSeek-V4.1-Flash,开箱即用的水平接近峰值

DeepSeek Harness 官方桌面端,抢鲜版! 一文中我做了复刻机必替 Astra 网页风格的实测,后来我把 DeepSeek-V4.1-Flash 分别接入到了 Pi Agent、Claude Code、DeepSeek Harness 做了更多尝试,先来看看结果情况

✦Pi Agent

✦Pi Agent

正文部分还行,首屏效果就差点意思了,有粒子效果,但偏离了的目标风格和布局

✦DeepSeek Harness 桌面端

✦DeepSeek Harness 桌面端

DSH 标准模式,我认为效果比 Pi Agent 好,首屏和侧边栏都符合预期,正文部分稍微有点弱

✦Claude Code

✦Claude Code

我感觉在Claude Code 中的发挥是超预期的,那个太空水滴有点经验!就是正文的布局有点不太理想

上面的任务有点主观了,所以我又换了一个实测:

Write an HTML and JavaScript page implementing space invaders

这个题目来自知名博主 Simon Willison,对,就是那个全网刷屏的鹈鹕骑单车测试的原创博主

我分别跑了 Pi Agent、Claude Code、DSH 标准模式、DSH 极简模式,先来看它们的效果,然后耗时、Token 消耗、缓存率与输出速度后面再分析

✦Pi Agent

✦Pi Agent

用时 36分09秒,Token 用量 9.7M tok,缓存命中 98.9%,输出速度(TPS) 未提供

✦DeepSeek Harness 标准模式

✦DeepSeek Harness 标准模式

用时 8分54秒,Token 用量 4.2M tok,缓存命中 98%,输出速度(TPS) 275 tok/s

✦DeepSeek Harness 极简模式

✦DeepSeek Harness 极简模式

用时 40分04秒,Token 用量 1.5M tok,缓存命中 99%,输出速度(TPS) 295 tok/s,任务失败

✦Claude Code

✦Claude Code

用时 9分34秒,Token 用量 3.0M tok,缓存命中 98%,输出速度(TPS) 约 205.5 tok/s

大总结:

只有极简模式失败了,其他三个完成度其实都差不多,我找机必替6-Astra当裁判,看了代码和操作电脑试玩了,它给出的评分也比较符合我的感觉:

实测结果:

  • 首次打开:四个版本都正常。
  • 开始、移动、射击、计分:四个版本都能玩。
  • 暂停与恢复:功能都可用,CC 和 Standard 的提示文字有问题。
  • 页面刷新:CC、Pi、DSH Standard 正常;DSH Minimal 失败。
  • 窄屏:Standard 最稳但偏小;CC 需要上下滚动;Pi 首页重叠;DSH Minimal 刷新后空白。
  • 辅助使用方面,Claude Code 和 DSH Standard 的操作按钮标注最好;Pi Agent的

    最后综合排名是 ① Claude Code ② Pi Agent ③ DSH 标准模式 ④ DSH 极简模式

    版本 综合分 评价 Claude Code 9.2 最懂原版。街机竖屏、飞碟、掩体破损等细节齐全,外壳和数据面板也很专业。暂停后按钮仍显示“Pause”,游戏中的 Enter 与“重新开始”说明不一致; Pi Agent 8.9 视觉效果最强。画面最大,、星空、发光、爆炸和拖动操作都很抓人,适合演示。窄屏首页出现标题压住计分区、底部文字重叠,难度也偏高 DSH 标准模式 8.7 最稳、最规整。刷新和宽窄屏都正常,玩法完整,整体很克制。电脑端和;暂停页同时出现“恢复”和“开始”提示,容易让人困惑 DSH 极简模式 7.2 首次打开的宽屏效果很好,颜色、粒子和射击反馈也很完整。刷新页面后会卡死,只剩空战场

    ✦耗时、Token 消耗、缓存率与输出速度分析

    ✦耗时、Token 消耗、缓存率与输出速度分析

    Claude Code 在交付质量、代码准确率和工程完整性上均位列第一。其上下文管理极其精炼,仅用 Pi Agent 约 1/3 的 Token 和 1/4 的耗时,就拿到了全场最优效果,属于生产级工业落地 ROI 最高的标杆方案

    Pi Agent 生成效果紧随 Claude Code,展现出强大的工具链调用和深度推理能力;但代价是极其沉重的上下文膨胀(172 条消息、85 次工具调用),Token 消耗为全场最高(9.7M tok,约为极简模式的 6.4 倍),端到端耗时长达 36 分钟。适合对质量有极致要求、但对成本与耗时完全不敏感的探索性任务

    DSH 标准模式以 8分54秒 的极限速度全场领跑,TPS 输出速度高达 275 tok/s,执行非常流畅利落;但在复杂任务的逻辑闭环和细节处理上弱于 Claude Code 和 Pi Agent,综合效果排在第三位。适合作为对交付时效要求极高、任务复杂度适中的日常高吞吐开发工具

    DSH 极简模式 Token 消耗做到了全场极致(仅 1.5M tok,比常规方案省下 84.5%),但单次上下文被极端压榨,导致模型缺乏全局视野,不得不通过多轮反复试探和多步反思来推进任务。不仅把总用时反向拉长至 40 分钟(全场最慢),最终效果也垫底

    :以上测试仅限这个任务,环境隔离也不一定理想,仅供参考

    给大家提供一个思路,如果你觉得某个模型不太好,或许可以换一个 Harness

    作者:Ai学习的老章 公众号:Ai学习的老章

    题图来自 Unsplash,基于CC0协议

    🔥 热词:#DeepSeek flash v4 · #deepseek flash v4 mindie · #deepseek flash v4 0731 · #DeepSeek v4 flash满血版低成本本地部署 · #DeepSeek V4 Flash能力暴涨 · #deepseek flash v4形象叫什么名字 · #DeepSeek V4 Flash正式版强在哪 · #deepseek flash v4正式版