从Prompt到Harness,AI圈这次是进化,还是又一次包装?

用户头像
南宁/设计爱好者/141天前/1244浏览
从Prompt到Harness,AI圈这次是进化,还是又一次包装?
这几天AI圈突然在聊一个词
Harness
 
我一开始看到的时候,其实有点警惕
又是一个新概念,还是一次包装?
 
我专门去翻了OpenAI那篇文章
结果发现一个很有意思的细节
正文里,“harness”这个词只出现了一次
然后这个“学科”就诞生了
 
结论是
Harness Engineering这个概念
既是真实的范式转移,也是被刻意包装的叙事标签
术语会轮换,但问题不会消失
它不是新技术,而是竞争重心迁移的信号
 
用工程手段,弥补模型的不可预测性
它的存在本身,就是模型“不可信”的证据
 
01
“Harness”这个词来自马具
缰绳、马鞍、衔铁
控制一匹强大但不可预测动物的完整装备
这个比喻其实很刻意,但我挺喜欢的
 
你可以把AI Agent想象成一匹好马
聪明、有力气、跑得快
但它不太守规矩
你把它牵到田里
它低头吃草;你让它拉车,它往反方向走
你喊停,它继续跑
 
AI模型就是这样
能力很强,但自己不知道该往哪走
 
Harness,本质上就是套在马身上
让人能“控制方向”的那一整套装备
 
它不是限制能力,而是让能力不失控
 
换成AI的语言
Harness不是Agent本身
而是管理Agent行为的完整基础设施
 
包括它能访问哪些工具、有哪些安全护栏、
有没有自我纠错的反馈循环,以及人类是否能持续观察它在做什么
 
如果你真的把Agent部署过
这一段其实不会陌生
 
你把它上线,然后去睡觉
第二天早上醒来
数据库没了
 
不是Agent出错了
是它“太认真”了
把它觉得多余的东西全清掉了
 
或者你让它跑一个长任务,跑到一半
它忘了自己在做什么,开始绕圈子
token一直在烧
最后给你一个你完全无法验证的结果
 
这不是科幻,而是现在很多团队每天都会遇到的情况
所以真正的瓶颈,其实不在模型,而在“怎么用模型”
 
02
那这个趋势是怎么来的?
我的判断是
模型已经开始商品化了
 
你可以看到
Claude、GPT-4、Gemini
包括一大批开源替代品
在主流基准测试上的差距已经在快速收敛
 
对大多数应用来说
这种差距已经很难构成决定性的优势
 
更现实的一点是
任何人都可以调用同一批API
 
你能用的模型,别人也能用
 
模型本身,正在变成一种“基础设施”,而不是壁垒
 
真正开始拉开差距的,反而是围绕模型的那一整套环境
能不能让Agent行为可预测、
架构是否清晰可读、出了问题能不能恢复
 
所以
护城河很可能不在模型本身
而在Harness
 
03
不过这里有一个细节
我觉得值得单独拿出来看
 
我专门去看了OpenAI那篇文章
标题叫“Harness Engineering”
但正文里,“harness”这个词只出现了一次
这个就有点耐人寻味了
 
更像是:文章先有了,概念是后来被命名出来的。
 
这个词,很可能是事后补上的
灵感甚至可以追溯到Mitchell Hashimoto更早的那篇博文
 
如果你把整个传播路径串起来看
其实会更清楚
一个大实验室发了一篇文章,
一个好记的词被提炼出来
像 Martin Fowler 这样的技术意见领袖开始转载
 
然后 Reddit 这种社区把它推上热门
一个“学科”,就这样诞生了
 
我自己其实更倾向于把这个过程看成一种“叙事机制”
而不是技术突破
 
这个模式,我们已经见过很多次了
把已有的工程实践重新命名
打包成一个新概念
然后制造一种隐性的压力
 
如果你不理解这个词
你就落后了
 
提示工程、上下文工程
再到现在的Harness Engineering
本质上更像是同一件事在不同阶段的切面
 
所以下个月如果有人再提出一个“脚手架工程”或者“编排工程”
引用同一篇SWE-agent论文
再来一轮传播,我也不会太意外
 
04
一个概念有没有价值
其实和它是不是“新的”关系不大
 
软件工程里已经发生过很多次类似的事情
比如“微服务”、“DevOps”,
本质上都是把已有的实践重新命名、重新打包
 
但这并不代表它们没有价值
恰恰相反,命名本身就是一种生产力
它可以让团队更快对齐认知,让招聘有明确方向
也让讨论有一个稳定的锚点
 
所以关键不在于这个词是不是“新”
而在于
它在帮谁建立共识
 
如果再往下看一层,其实会发现
这场讨论背后是有很明显的利益结构的
 
大模型阵营(OpenAI、Anthropic)
更希望你相信
模型本身才是核心
 
而框架阵营(LangChain、各种Agent框架)
则更希望你相信
环境才是关键
 
像Claude Code这种极简Harness
本身就是一种很隐性的表达
如果模型足够强
框架应该尽可能变薄
 
 “Harness Engineering很重要”这句话
从不同人嘴里说出来
其实含义是完全不同的
这才是真正的战场
 
05
但不管不同阵营怎么说
有一个现象是相对中立的
 
我看到一个很有意思的实验
当研究者主动减少Agent可用的工具
甚至移除掉80%的工具时
整体性能反而提升了
 
原因其实也不复杂
不受约束的Agent
会把大量token浪费在探索无效路径上
 
这和我们的直觉是相反的
我们总觉得,给AI更多能力、更多工具
它就会变得更强
 
但实际情况更接近一个很老的原则
约束本身,就是能力的一部分
 
有点像十四行诗的格律限制
反而会逼出更好的表达
 
还有一个很典型的信号是Karpathy的工作流变化
从“主要是我写代码,Agent辅助”
逐渐变成“主要是Agent写代码,我来做少量修改”
 
这件事如果只看表面
很容易被解读成“模型赢了”
 
但我更倾向于另一种理解
一旦Agent开始具备连续完成复杂任务的能力
问题就不再是“它能不能做”
而是“它什么时候会做错、以及你能不能控制它”
 
换句话说,能力一旦跨过某个阈值
系统的脆弱性也会同时被放大
这也是为什么
Harness这种东西会变得越来越重要
 
06
所以
Harness Engineering是炒作吗?
 
我现在的答案是
这个词,大概率会过时
也一定会被更好的词替代
 
但它指向的问题
不会消失
 
当模型能力不再是瓶颈之后
真正的竞争,会不可避免地转向系统设计
 
也就是你如何约束、引导、以及控制这些
越来越强但仍然不稳定的能力
 
从这个角度看
这不是什么新学科,而是“软件工程”在遇到“AI可靠性”之后
一个迟早会出现的阶段
 
只是现在
刚好到了需要给它一个名字的时刻
 
如果你现在在用Agent
其实可以用一个很简单的标准自检一下
 
你现在遇到的问题,是“模型不够强”,
还是“它太强,但你控制不住”?
这两个问题,指向的是完全不同的答案。
 
25
举报
|
10
分享
相关推荐
评论
用户头像
评论你的想法~
表情
喜欢TA的作品吗?喜欢就快来夸夸TA吧!
推荐素材
奶牛猫
魔法礼帽鲜花插画 创意图案设计素材包
金蛇送福 | 蛇年主题卡通插画设计
蓝色背景下的台灯铅笔和AI字母组成的静物
AI Prompt工程深度解析PPT
金蛇送福 | 蛇年主题卡通插画设计
13个抽象巨浪波浪背景(免费商用)
锦鲤伴佳人·国风古韵人物IP设计
【矢量/PSD】二次元少女角色立绘
新年插画 | 12只蛇卡通形象设计
黄色台灯和黄色灯泡照射出的光交织在AI字
记录 PPT创作 阅读助手 AI 笔记
潮酷角色插画 · 赛博墨镜猫
蓝色背景下的台灯和AI字母组成的静物照
记录 PPT创作 阅读助手 AI 笔记
AI音乐创作系统界面
AI人工智能机器人正在写作
元界械语·绮幻少女纪IP创意设计
蛇年IP全套新年产品原创设计
金蛇送福 | 蛇年主题卡通插画设计
记录 PPT创作 阅读助手 AI 笔记
AI艺术量子创作系统-100组商业级艺术提示词正式发布
清新雏菊少女扁平风元气少女ip形象
新年蛇年卡通形象:蛇年暴富插画
12张粉红色调雪山高清图片(免费)
你可能喜欢
相关收藏夹
地产VI
地产VI
地产VI
地产VI
大家都在看
登录注册