上一期视频聊了个态度:全网都在吹 Codex,但对大部分不写代码的人来说,它没那么神——你有更合适的选择。视频里点了一串工具的名字,受限于时长,很多没来得及展开。

这篇是那期视频的番外。视频是前段时间录的,而 AI 这摊子东西几周就是一个样,所以动笔之前,我把里面提到的每款工具都重新查了一遍最新进展:有些当时的判断被验证了,有些数字已经过时,还有一两处,现在的事实和录视频时几乎反了过来——最典型的就是 OpenAI 的旗舰型号。下面这 9 款工具,我按最新情况重新摊开,对比一遍。

先上一张总表

这里的”定位”不是营销话术,是照着官方文档和最近的评测报道整理的。

工具一句话定位核心机制适合谁
Codex(OpenAI)执行者型编程 agentGoal 模式自主规划-执行-自测边界清楚的执行任务,能等它跑
Claude Code(Anthropic)搭档型编程 agent长会话记忆 + 可扩展 skills从 0 到 1 搭工作流、要人机协作
DeepSeek V4-Pro平价模型,接进现成的壳官方适配 Claude Code 兼容层想省钱又不想离开 Claude Code 生态
OpenClaw开源自托管全能 agent自己部署,拿聊天软件当界面愿意折腾、能接受偶尔翻车
Hermes Desktop(Nous Research)自学习型桌面 agent持久记忆、跨会话沉淀技能重复性自动化、想要”越用越懂你”
Trae / Cursor直连国产模型的 IDE内置 DeepSeek,选一下就切要写代码、想免梯子的新手
WorkBuddy(腾讯)非程序员办公 agent多端 IM 远程操控运营、行政,完全不想碰代码
Craft Agents(Luki Labs)Claude Agent SDK 协作端任务收件箱 + 三档权限团队协作、要看得见 AI 在干嘛
PromaClaude Agent SDK,中国向飞书原生桥接 + 任意模型接入深绑飞书生态、想自己接模型

Codex 和 Claude Code:「谁更强」没有标准答案

视频里讲过它俩设计哲学的差别:Codex 是”执行者”,Claude Code 是”搭档”。这个判断没变。但真去翻评测榜单,“谁更强”这件事,你会发现根本没有一个干净的答案。

举个例子:在更难、更贴近真实多文件仓库的 SWE-bench Pro 上,Claude 最新的 Opus 4.8 拿到约 69%,是目前活跃模型里的第一梯队;而在终端环境下的编程任务上,GPT 这条线一直咬得很紧、多数时候还略占上风。问题是,这些数字每隔几周就被刷新一次,连评测本身都在升版本(比如 Terminal-Bench 从 2.0 升到 2.1,两版分数不能直接摆一起比)。所以下次看到有人拿单一评测吹”谁碾压谁”,多问一句就好:测的是哪类任务、哪个版本、什么时候的数据。

Codex 这边最实在的更新,是 Goal 模式在 5 月 21 日全面 GA 了——macOS App、IDE 插件、CLI 三端同步,同期还上了两个配套:截图直接喂上下文的 Appshots,以及能在锁屏 Mac 上远程跑任务的 Locked Computer Use(有地区限制,欧盟 / 英国 / 瑞士暂时用不了)。用户增长也很猛,官方口径里 Codex 的周活从 4 月的 400 万,一路涨到 7 月中旬的约 800 万。至于视频里吐槽的”xhigh 挂了快 100 小时”,从社区反馈看不算个例——不过 GA 公告只讲功能、没公布可靠性数据,翻不翻车更多得看具体是什么任务。

Codex Goal 模式说明

推理强度档位选择,从低到超高

多数 harness 都有类似”推理强度”的档位,但调到最高,不代表任务就一定能收尾。

DeepSeek 那条线:不只是接入 Claude Code,是要自己做一个

录视频那会儿,我只看到一条招聘新闻,就顺口猜了句”期待 DeepSeek 出自己的桌面端工具”。现在查下来,事情比那个猜测具体得多。

DeepSeek 确实在组一支专门的 Harness 团队,官网挂出了「Agent Harness 产品经理」「Harness 研究工程师」的岗位,内部把这件事拆成一句话——「Model + Harness = Agent」,意思是除了模型本身,剩下那层”外壳”(harness)他们打算自己做。带队的是今年 3 月加入的崔添翼,前 Jane Street 工程师,眼下还在 X 上公开招人。多家报道都指向同一个目标:做一个对标 Claude Code 的 DeepSeek Code Harness,直接下场和 Claude Code、Codex 正面竞争。

崔添翼在 X 上发布 DeepSeek Harness 团队招聘信息 DeepSeek Harness 团队负责人崔添翼在 X 上公开发的招聘帖:他本人是终面。

换句话说,DeepSeek 这步不是”再出一个便宜模型、接进别人的壳里”这么简单,而是连模型带壳一起做。对普通用户当然是好事——多一个大概率还便宜的选择。但也别急着等:这东西目前还停在”招人”阶段,产品没影。

在自家 harness 落地之前,DeepSeek 现在的策略是”谁的壳都能接”。官方文档里有一页专门讲怎么把 DeepSeek 接进现成的编程 agent,直接列出来的是 Claude Code、OpenCode、OpenClaw 这几个;此外 DeepSeek 还维护了一份更全的 awesome-deepseek-agent 清单,本文提到的 WorkBuddy/CodeBuddy、Hermes 也都在里面。接法基本就是改几个环境变量:

export ANTHROPIC_BASE_URL=https://api.deepseek.com/anthropic
export ANTHROPIC_AUTH_TOKEN=<你的 DeepSeek API Key>
export ANTHROPIC_MODEL=deepseek-v4-pro
export ANTHROPIC_DEFAULT_OPUS_MODEL=deepseek-v4-pro
export ANTHROPIC_DEFAULT_SONNET_MODEL=deepseek-v4-pro
export ANTHROPIC_DEFAULT_HAIKU_MODEL=deepseek-v4-flash
export CLAUDE_CODE_SUBAGENT_MODEL=deepseek-v4-flash
export CLAUDE_CODE_EFFORT_LEVEL=max

视频里提过”接 DeepSeek 还得自己配搜索”这个坑,现在不用了——DeepSeek 的接口原生支持 Claude Code 的 Web Search,模型判断需要联网时会自动走 DeepSeek 的通道去搜,不用你再接第三方(多搜的请求会另算 token)。

DeepSeek 官方文档:接入 Agent 工具列表 DeepSeek 官方文档里能接入的 harness 列表,几乎覆盖了本文提到的所有工具。

Claude Code 中触发 Web Search 功能的示例 Claude Code 里原生调用 DeepSeek Web Search 的实际效果。

两个开源狠角色:OpenClaw 和 Hermes Desktop

这俩都不是”公司产品”,而是社区自发跑起来的开源 agent,但走的是两条完全不同的路。

OpenClaw 走”全能自托管”路线:自己找台机器把它部署起来,它就能用 WhatsApp、Telegram、iMessage 这些聊天软件当界面,帮你管日程、清收件箱、代发消息,官方号称 50 多个集成。规模是真夸张——GitHub 上大约 8 个月涨到近 38 万 star,今年 3 月一度超过 React,成了全站最热的仓库之一。

但它也是话题最大的那个。作者是 PSPDFKit 的创始人 Peter Steinberger(项目从 Clawd 一路改名到 Moltbot、再到 OpenClaw),而他本人今年 2 月已经加入了 OpenAI,某种意义上”亲爹去了对家”。更要紧的是安全:短短几天爆出 9 个 CVE,其中一个接近满分严重级,大量实例还裸奔在公网上,卡巴斯基和国内都发过安全提醒。有人评价它”要么是 2026 年最重要的开源项目,要么是最危险的”——这话是评论员的调侃,但方向没错:自动化程度越高,翻车代价越大。真想上手,先把安全配置搞明白再说。

Hermes Desktop(Nous Research 出品)走的是”自学习”路线,6 月初刚发桌面客户端,本质是给已有的 Hermes agent 框架套了个跨平台图形界面(macOS / Windows / Linux 都有),不是新模型。卖点是”越用越懂你”:它有持久记忆,会记住你的项目,也记得自己上次是怎么解决某个问题的,还能接 Telegram、Discord、Slack、WhatsApp、Signal、邮件一堆消息入口。项目本身是 MIT 协议、免费;不过要用 Nous 托管的模型服务,得走它家的 Portal(分免费和付费档),不是完全零账号。

国产工具的分工:Trae 写代码,WorkBuddy 管办公

视频里把这两个放一起讲,其实它们服务的是完全不同的人群,谁也不挡谁。

Trae(字节跳动)国内版是免费的写代码 IDE,年初上线,官方说”国内版长期免费”。5 月起它把 DeepSeek-V4-Pro 做成了内置模型,IDE 和新的 SOLO 智能体模式里选一下就能切,不用自己配 API、也不用挂梯子——“Cursor 的国内直连平替”这个定位挺准。(内置的 V4-Pro 目前还挂着 Beta,高峰期可能要排队。)

WorkBuddy(腾讯)面向的是完全不写代码的运营、行政人群——注意它和腾讯给程序员用的 CodeBuddy 是两个产品,别搞混。它的个人版年初就能装来用,6 月 5 日的腾讯云 AI 产业应用大会上又发了企业版。核心能力是”听懂人话、自己把多步骤任务拆开做”,能处理 Excel、PDF、PPT、浏览器自动化这类办公杂活。最有意思的是远程操控:它跑在你自己的电脑上,你用微信、企业微信、QQ、飞书、钉钉给它发条消息(甚至发条语音)就能让它干活,干完再把结果回传给你——这套功能腾讯自己起了个”小龙虾”的外号,明摆着是冲着 OpenClaw 来的。

同样基于 Claude Agent SDK,Craft Agents 和 Proma 走了两条路

这两个都是”给 Claude 套个桌面壳”的思路,底层引擎都是 Anthropic 的 Claude Agent SDK(和 Claude Code 同源,这个 SDK 前身就叫 Claude Code SDK),但产品长得很不一样。

Craft Agents 由笔记工具 Craft 背后的 Luki Labs 开发,Apache 2.0 开源。它强调”看得见、可审阅”:一个收件箱式的任务界面,Explore / Ask to Edit / Execute 三档权限,能同时接 GitHub、Linear、Slack、API 和本地文件。适合团队协作——先让它以只读的 Explore 模式跑出一份执行计划,你看过了再切到 Execute,放手让它做完。

Proma 由国内开发者 ErlichLiu 主导,更像”中国用户的长期工作台”:原生桥接飞书 / Lark 机器人(钉钉、微信也在计划里),模型上支持 Anthropic、DeepSeek、Kimi、OpenAI、Gemini,还有通义、豆包、智谱这些国产的,数据默认本地优先存在 ~/.proma/ 下(JSON/JSONL 格式,不用额外数据库)。协议是 AGPL-3.0,另有商用授权。它除了默认的 Claude 运行时,还能切到一个 Pi 运行时,算个小小的差异化。

一句话分这俩:Craft Agents 更像团队协作工具,Proma 更像个人长期工作台,而且更贴国内生态。(下方图片区有两者的实际界面截图。)

还有个容易被忽略的选择:GPT-5.6 的深度思考

最后补一个视频里点到、但值得单拎出来说的:OpenAI 网页版的深度思考模式。

先更新一个关键事实:OpenAI 现在的旗舰,是 7 月 9 日发布的 GPT-5.6(一家三口 Luna / Terra / Sol,Sol 是最顶那档)。它接替的是 4 月的 GPT-5.5——5.5 当年是自 GPT-4.5 以来第一个完全重训的基座模型,账面成绩很能打(Terminal-Bench 2.0 拿过 82.7%),但只当了十来周旗舰,就被 5.6 换了下来。5.6 主打编码上更省 token、综合更强。

要注意的是,它和 Codex 不是一码事:Codex 是”agent 外壳 + 模型”的组合,会自己规划、执行、自测;GPT-5.6 的深度思考是纯模型的推理能力,你问它答、不替你动手。但对”一个大项目要深度调研、把思路理顺”这种活,它确实是目前性价比很高的选项——前提是你能迈过国内访问和网页端限制这两道门槛。

怎么选:看你的活配哪种”哲学”,别看谁最火

9 个工具摆一起看完,其实还是视频里那句话:别追热点,追匹配。

  • 要执行边界清楚的活、能等结果:Codex
  • 要从 0 到 1、需要人机协作:Claude Code(想省钱可以接 DeepSeek V4-Pro)
  • 愿意自己部署、追求全能自动化:OpenClaw(先搞定安全)
  • 要重复性自动化、希望它越用越懂你:Hermes Desktop
  • 写代码要国内直连:Trae / Cursor
  • 做运营办公、完全不碰代码:WorkBuddy
  • 团队协作、要看得见 AI 在干嘛:Craft Agents
  • 深绑飞书、想自己接模型:Proma
  • 大项目要深度调研思考:GPT-5.6 深度思考

而 DeepSeek 那条线值得接着盯——它不满足于只当”接进别人壳里的便宜模型”,是奔着自己做一个 Claude Code 平替去的。等它的 Harness 团队真交出东西,这张对比表大概率得重画一次。

评论区聊聊:你现在每天在用的,是哪个 AI 工具?想要一份我整理的、专门给非程序员的 AI 工具选型清单,后台回复”选型”领取。