用了大半年Codex,2026年下半年开始全面转到Kimi。Arena.ai 七月更新的 Frontend Code Arena 排行榜上,Kimi K3 以 1679 分排在第一,把 Claude Fable 5 和 GPT-5.6 Sol 甩在了身后。上一代 K2.6 还在第十八名,一代直接跳到榜首。 这张图在开发者圈子里转了一阵。但聊完排名,很多人回到现实:模型再强,用不了也是白搭。 OpenAI Codex 就是典型。能力不差,但国内开发者面对的还是老问题 —— 网络不稳定、账号风控、支付麻烦,正跑着任务突然断连,节奏全乱。折腾环境的时间,比写代码还多。 所以问题不是有没有好工具,而是有没有一个稳定可用、不用折腾、能力还在线的工具。 Kimi Work 值得在这里说一句。它是 Kimi 官方桌面客户端,底层就是 Kimi K3 模型 —— 没错,就是排行榜上那个第一的模型。但和 Codex 这类纯编程工具不同,Kimi Work 的定位更广:它不只是帮你写代码,还是一个能帮你完成整项工作的桌面智能体。 Goal 模式是它的核心能力之一。你告诉它目标和验收标准,它会持续推进,不用一步步指挥。复杂任务会自动唤醒多智能体网络,最多调用超过 300 个 Agent 分工协作。写代码、查资料、做调研、生成文档,这些可以串在一起完成。国内直连,不用折腾网络和支付。转了之后发现,场景不同感受完全不一样。
这篇不讲参数和功能列表,就讲五个真实工作场景,Codex怎么做的、Kimi怎么做的、差异在哪。
场景一:在已有项目里加新功能
这是开发者高频场景。拿一个Node.js后端项目举例,需要加一个用户通知模块,涉及数据库模型、API路由、邮件发送、单元测试,大概七八个文件。
用Codex的时候,我在终端里描述需求,它先扫项目结构,然后给出修改计划,确认后逐个文件改。整体流程顺畅,GPT模型对常见模式的识别很准,生成的代码风格跟项目原有代码一致性不错。偶尔会在第三方库版本上出错——它训练数据里的版本跟项目实际用的版本对不上,需要人工纠正。
用Kimi Code做同样的事,流程类似:Plan模式先出计划,确认后执行。K2.7 Code默认模型响应快,补全和小修改体验流畅;复杂模块切换K3后,多文件协调能力明显更强。一个实际感受差异:Kimi Code对国内技术栈的理解更好——项目里用到了阿里云SDK和企业微信接口,Codex偶尔会给出过时的API用法,Kimi Code这方面出错率低一些。反过来,如果项目用的是Vercel、Supabase这类海外服务,Codex的熟悉程度更高。
基准数据可以参考:K3在Program Bench上77.8分,SWE Marathon上42.0分,均排名第一;Fable 5在FrontierSWE上86.6分,高于K3的81.2分。日常开发差距不大,超大型项目的复杂重构头部模型仍有优势。
场景二:排查生产环境bug
凌晨告警,某个接口响应超时。需要看日志、定位代码、分析原因、出修复方案。
Codex处理这类问题的优势在于终端操作成熟:贴日志进去,它能快速定位相关代码路径,给出假设,然后跑命令验证。Terminal Bench上GPT-5.6 Sol 88.8分,K3 88.3分,差距很小。实际体验中两者都能完成"看报错→找代码→提修复"的闭环。
Kimi Code的一个加分项是中文日志理解。生产环境的日志混着中文业务术语和英文堆栈,Kimi Code对中文语义的理解更准确,有时候Codex会忽略中文注释里的关键线索。另外Kimi Code支持后台执行,排查过程中让它跑测试或分析日志,我可以同时看监控,不用干等。
这个场景两者打平。如果日志全英文且涉及AWS/GCP等海外云服务,Codex略顺;如果是国内云服务加中文业务逻辑,Kimi Code略顺。
场景三:批量处理两百多份文件
这不是编程场景,但很多开发者和运营都会遇到。季度末需要把两百多份PDF合同提取关键信息(甲方、乙方、金额、日期、到期日),汇总到Excel,再按到期月份分类。
用Codex做这件事很别扭。Codex能写Python脚本处理,但你得先描述清楚PDF格式、写提取逻辑、调试正则、处理异常格式。本质上是你在指挥它写一个数据处理程序,而不是它直接帮你处理。而且Codex操作本地文件需要沙箱权限配置,处理完还要手动把结果搬出来。
用Kimi Work做这件事是另一种体验。我在Goal里写:"读取合同文件夹里所有PDF,提取每份合同的甲方、乙方、合同金额、签订日期、到期日期,汇总成Excel,列名用中文,按到期月份分sheet,保存到桌面。"然后它自己读文件、提取信息、生成Excel。中间遇到几份扫描件格式特殊,它标记出来让我确认,没有瞎填。
这就是Goal模式和指令模式的区别。用Codex我得想"怎么让它做"——写脚本、调库、处理异常;用Kimi Work我只需要想"我要什么结果"。Agent Swarm在这种批量场景下发挥作用,多个Agent并行读取和提取,速度比串行快。当然,两百份文件的信息提取不可能百分之百准确,我花了二十分钟抽查核对,发现几处OCR识别错误,手动修正了。但比起自己写脚本加逐份核对,省了大量时间。
这个场景Kimi Work明显更合适。不是Codex能力不行,而是产品定位不同——Codex是为写代码设计的,处理文件是它的副业;Kimi Work是为桌面任务设计的,这是主业。
场景四:竞品调研并生成报告
需要调研四款桌面Agent产品的定价、核心功能、目标用户,输出一份带对比的Markdown报告,信息来源限官网。
Codex做网页调研的方式是调用搜索API拿文本摘要,然后整理。问题在于:搜索摘要经常过时或不完整,定价页面可能是动态渲染的搜不到,需要登录的内容完全看不到。我通常得自己打开官网核对,Codex整理的初稿只能当骨架。
Kimi Work的WebBridge是一种浏览器自动化Agent,它实际打开浏览器访问每个官网,等页面加载完,提取定价和功能信息。它能处理动态渲染页面,能点击展开折叠内容,能翻页。在BrowseComp基准测试中K3得分91.2。实际体验:它访问了四个产品官网,逐个提取定价档位和功能列表,遇到需要点击"查看全部功能"的按钮会自己点,最后生成了结构清晰的报告。我核对了一遍,信息基本准确,只有一处定价是旧的(官网刚更新过),手动改了。
报告生成后我让它直接存成Markdown文件到桌面,又让它转成了Word格式。DECK-Bench测试中K3得分73.5,Online Exp Bench得分75.5,反映的就是这类在线任务和文档生成能力。
这个场景Kimi Work胜出。核心差异不是模型智力,而是工具形态:搜索API给你的是二手摘要,浏览器自动化给你的是一手页面内容。
场景五:每天早上自动生成行业早报
这是我在Codex上根本没法实现的需求。我想要一个每天早上8点自动运行的任务:抓取几个信息源的AI行业新闻,按类别整理,生成摘要,存到桌面,重要的标红。
Codex没有定时任务能力。你得自己写cron job调API,或者用GitHub Actions之类的外部调度,配置成本不低,而且Codex本身是交互式工具,不适合无人值守运行。
Kimi Work内置定时任务引擎,设定时间和Goal就行。免费版能设2个定时任务,付费版更多。引擎就一种模式,没有复杂配置。我设了每天8点执行,它自动打开浏览器访问信息源、整理新闻、生成早报文件。我到公司打开电脑就能看到。偶尔信息源网站改版导致抓取失败,它会在报告里标注哪条没抓到,不会静默失败。
这个场景没有可比性,因为Codex不具备这个能力。定时任务加Goal模式加WebBridge的组合,是Kimi Work的差异化能力。
诚实说:Codex哪些地方还是更强
讲了五个Kimi顺手的场景,也要说Codex依然有优势的地方。
英文开源项目贡献:给一个大型英文开源项目提PR,Codex对项目惯例、英文commit message、英文PR描述的处理更老到。Kimi Code能做,但英文表达的地道程度和对海外开源文化的理解上有差距。
OpenAI生态深度绑定:如果团队用GitHub Copilot Enterprise、OpenAI API、ChatGPT团队版一整套,Codex在生态内的协作更丝滑。
超大规模代码库:百万行级别的单体仓库,头部模型在代码索引和跨文件理解上的积累更深。K3在FrontierSWE上81.2分,Fable 5以86.6分领先,这个差距在超大型项目上可能感知到。
英文技术社区资源:遇到问题搜Stack Overflow和GitHub Issues,Codex训练数据中英文技术内容的覆盖更广。
Kimi哪些地方更强
中文场景:中文注释、中文报错、中文文档、国内技术栈和云服务,理解准确率更高。
桌面自动化:Goal模式、WebBridge、文件操作、定时任务,这是Kimi Work的主场,Codex在这块能力有限。
成本和便利:国内直连,手机号注册,支付宝微信付费,49元每月起步。不用代理,不用海外信用卡,不用担心账号被封。
产品矩阵:Kimi Work管桌面任务,Kimi Code管编程,Kimi API管自定义集成,一个账号打通。需要把编程和办公串起来时——比如Kimi Code写完代码,Kimi Work自动生成更新日志发给团队——这种组合流是单一Codex给不了的。
专业数据接入:同花顺、天眼查、华宇元典法律数据库直连,金融和法律场景不用自己找数据源。
谁该换,谁别急着换
如果你是国内开发者,主要做中文项目或国内业务,日常开发加办公自动化都有需求——换。Kimi Code加Kimi Work的组合覆盖你的场景,综合成本更低。
如果你是运营、产品、金融、法律等非编程岗位,需要AI帮你处理文件、调研信息、定时任务——直接用Kimi Work,Codex对你来说本来就不是合适的工具。
如果你在海外团队或做纯英文国际项目,深度绑定OpenAI生态,且有合规的网络和支付条件——可以继续用Codex,等Kimi国际版或根据团队需求再评估。
如果你想零成本试试——Kimi Work和Kimi Code都有免费额度,Kimi官网下载,Kimi Code官网装CLI,试过再决定。
工具是手段,解决问题才是目的。我转过来之后没后悔过,不是因为Kimi全面超越了Codex,而是因为在我的实际工作场景里,它用起来更顺、更稳、更省心。
评论
更多评论