$ grep -r "series:harness" · 8 篇
Harness 深水区
Agent Harness 的设计、踩坑与方法论
-
DeepSeek Harness:一台为模型而造的机器
大家拿 coding agent 的记分牌给 DeepSeek Harness 打分,越量越失望。读完它全部设计文档、翻完一万多个 commit 之后,我的判断是:它是一台为模型而造的机器——人可以用,但人不是它的目的。
[series:Harness 深水区] [read:11min] #Agent#Harness#DeepSeek
-
DeepSeek 没给 Harness 做 App,我做了一个
官方入口是一行 npx 命令,挡住了太多好奇的人。我用 Tauri 给 DeepSeek Harness 封了个双击即用的桌面版——非官方、开源、数据在本地。壳几乎一个功能都没加,只多了一个键。
[series:Harness 深水区] [read:8min] #Agent#Harness#DeepSeek
-
为什么有人已经在用 AI 工作,而你还只让它回答问题?
同样在用 AI,为什么有人只拿答案,有人却能让它协助把报告推进到可交付?从回答、动作到工作,本文用写报告的例子讲清 Harness 是什么。
[series:Harness 深水区] [read:8min] #Agent#Harness#AI入门
-
DeepSeek V4 Flash 应该怎么用:把强模型留给不确定性
一个模糊的愤怒的小鸟测试,为什么不能告诉你模型到底好不好?我把真实项目拆成思考、规划、执行、验收和修复,再按能力与成熟度给模型分工。
[series:Harness 深水区] [read:12min] #DeepSeek#Agent#模型选择
-
同一个 DeepSeek-V4-Flash,为什么在 Codex 里像换了模型?
同一个 DeepSeek-V4-Flash 后端,在 Codex 和 Claude Code 里呈现出不同的长任务交付结果。本文把背景压缩成证据入口,重点拆解协议、工具契约、上下文恢复和验收如何决定模型能力能否稳定兑现。
[series:Harness 深水区] [read:16min] #Agent#Harness#DeepSeek
-
Model + Harness = Agent:产品差距的大头,不在模型
这几天我在用 Kimi K3:同一个模型,放进自家 CLI 和放进 Claude Code,体验差了一截。模型和 Harness 是托着你任务的两根柱子,任务能垒多高,取决于较细的那根——在一篇立场论文汇总的 coding-agent 样本里,换个 Harness 能把分数挪动十几个百分点;作为对照,被报告为"有意义模型进步"的幅度通常只有 2 到 4 个点。这篇把 Harness 拆成六件事,说清楚为什么它是 Agent 产品的真正战场。
[series:Harness 深水区] [read:10min] #Agent#Harness#方法论
-
我完全信任我的 AI,除了它说的"我做完了"
这大半年,我的 AI 伪造过我的确认、把干完的活报成"零改动"、测试全绿却在真机上全军覆没。但这篇不是"别信任 AI"——恰恰相反。我信任它的能力;正因为要把越来越重的工作交给它,才要在我们之间修一座桥。验证不是不信任:在异步协作里,验证就是信任的实现方式。
[series:Harness 深水区] [read:10min] #Agent#Harness#验收
-
上下文压缩吃掉了我的约束:一次真实翻车与修法
任务开头明确说过"不许动 X 模块",两小时后 Agent 把它改了——约束被自动压缩摘要吃掉了。这篇讲清楚这次翻车的机制级根因,和三条可以直接抄走的修法:规格外置、压缩分类、一致性自检。
[series:Harness 深水区] [read:3min] #context-engineering#踩坑#Claude Code