AI程序员Devin卧底工作群修bug！和CTO聊技术，”顶级码农水平”

梦晨 2024-03-17 12:49:43 来源：量子位

Agent的ChatGPT时刻

梦晨西风发自凹非寺
量子位 | 公众号 QbitAI

首个AI程序员Devin，现身明星创业公司内部群。

为解决一个技术问题，Devin借用了其创造者的账号，与客户公司的CTO交流，并根据回复调整了代码方案。

对话之专业，围观者看了直呼这个世界太疯狂。

AI程序员Devin卧底工作群修bug！和CTO聊技术，

事情发生在办公软件Slack，截图中的akshat是AI基础设施创业公司Modal Labs的CTO Akshat Bubna。

Modal Labs也是Devin开发商Cognition的首批客户之一。

此时Devin正披着他的创造者之一、IOI金牌得主Steven Hao的马甲。

AI程序员Devin卧底工作群修bug！和CTO聊技术，

对话的开始，AI程序员Devin正在询问有关Modal Lab平台的密钥的生命周期问题，特别是密钥更新后传播到正在运行的应用程序所需的时间。

Devin表示自己已经查阅了文档，包括密钥和环境变量指南、CLI命令参考、API参考以及容器生命周期钩子和参数，但依旧没有找到关于密钥传播时间的明确信息。

Devin询问了更新的密钥通常需要多长时间才能被运行中的应用程序使用，因为这对于他们的运营至关重要，了解这一点将有助于管理他们的部署流程。

AI程序员Devin卧底工作群修bug！和CTO聊技术，

人类CTO解释说，当密钥更新时，他们不会使已经运行的Modal容器失效，但是新启动的容器将会读取更新后的值。

Devin对此表示感谢，并决定暂时采用手动方法来管理Modal中的密钥，即在需要时调用modal deploy命令来触发相关应用程序容器的重启。

AI程序员Devin卧底工作群修bug！和CTO聊技术，

看完整个过程后，同样是AI创业者的Raunak Chowdhuri评价到：

发现问题、创建工单、调整代码，最好的人类开发者就是这么工作的。

AI程序员Devin卧底工作群修bug！和CTO聊技术，

Devin更多实测结果

拿到Devin早期测试资格的人和公司并不多，不过还是陆陆续续有人晒出实测结果。

热衷AI的沃顿商学院教授Ethan Molick试过后，认为其新颖的实时交互方式是最值得关注的。

您可以随时与它“交谈”，就像与人交谈一样，它会在后台不断地执行和调试您的想法。

AI程序员Devin卧底工作群修bug！和CTO聊技术，

在测试中，Ethan Mollick要求Devin开发一个解释“创业公司融资中的股权稀释”的网站。

不过他透露，AI还无法在没有任何帮助的情况下，自主且无差错地完成这项工作。

要想把一个重大项目交给人工智能来完成，还有很长的路要走，但这仍然是一个令人着迷的开始。

AI程序员Devin卧底工作群修bug！和CTO聊技术，

另一位晒出测试过程的创业者Mckay Wrigley更激动一些。

AI程序员Devin卧底工作群修bug！和CTO聊技术，

在他晒出的27分钟测试中，只发了一个GitHub连接，让Devin部署来自开源项目的代码。

AI程序员Devin卧底工作群修bug！和CTO聊技术，

Devin自主把任务拆解成一系列子步骤，并一步步开始执行。

AI程序员Devin卧底工作群修bug！和CTO聊技术，

执行过程中，Devin在安装Supabase数据库时遇到了障碍，自己打开了对应的Github仓库开始查阅文档……

AI程序员Devin卧底工作群修bug！和CTO聊技术，

从后续终端反馈中可以看出，Devin查到了运行Supabase所需的各种端口和密匙都应该填什么。

（装过的都知道，雀食挺麻烦……）

AI程序员Devin卧底工作群修bug！和CTO聊技术，

与此同时，Devin还在根据实际情况不断修改自己的后续计划。

AI程序员Devin卧底工作群修bug！和CTO聊技术，

一段时间过后，一个本地的聊天机器人程序就跑起来了。

AI程序员Devin卧底工作群修bug！和CTO聊技术，

测试一段时间后Mckay Wrigley认为，Devin已经可以算Agent的ChatGPT时刻。

AI程序员Devin卧底工作群修bug！和CTO聊技术，

复现Devin计划ing

Devin这边大伙还在接连测试，另一边开源“复现”方案也在进行中……

这不，GitHub三万Star项目MetaGPT就上新了“开源版Devin”。

AI程序员Devin卧底工作群修bug！和CTO聊技术，

名为数据解释器（Data Interpreter）：

AI程序员Devin卧底工作群修bug！和CTO聊技术，

同Devin一样，Data Interpreter也能实现自主编程，能迭代式观察数据，预测分析病情进展、机器运行状态；还能构建机器学习模型、进行数学推理、自动回复电子邮件、仿写网站……

比如从英伟达股价数据中分析收盘价格趋势：

AI程序员Devin卧底工作群修bug！和CTO聊技术，

分析数据预测葡萄酒质量：

AI程序员Devin卧底工作群修bug！和CTO聊技术，

除此以外，阿里Qwen成员Binyan Hui等人开启了OpenDevin项目，刚刚起步已获得1.2k Star。

AI程序员Devin卧底工作群修bug！和CTO聊技术，

Binyan Hui发推文表示，已有一个初步的路线图和一群优秀的人在努力工作，在很短的时间内就完成了前端原型。

同时项目团队也在招新成员：

AI程序员Devin卧底工作群修bug！和CTO聊技术，

另外，还一个名为Maisa AI的团队推出了Maisa KPU（Knowledge Processing Unit），被网友认为与Devin有一些竞争。

AI程序员Devin卧底工作群修bug！和CTO聊技术，

目前Maisa KPU处于测试阶段，它可以解决复杂问题和推理，团队发布的基准测试结果如下：

AI程序员Devin卧底工作群修bug！和CTO聊技术，

根据demo展示，KPU可以成为“智能客服”，在客户没有正确写好订单号的情况下，帮助客户解决订单未送达的问题：

AI程序员Devin卧底工作群修bug！和CTO聊技术，

Devin基准测试技术报告发布

最近，Devin创始团队Cognition还发布关于SWE-bench测试的技术报告。

除了之前已公布的测试结果之外，团队还透露了一些新消息。

AI程序员Devin卧底工作群修bug！和CTO聊技术，

比如，Cognition的目标之一是让Devin这个专门从事软件开发的AI智能体能够成功地为大型、复杂的代码库贡献代码。

选择在SWE-bench上端到端运行智能体，也是考虑了它更接近现实世界的软件开发。

此外，研发团队还透露，为了防止Devin在测试中作弊，比如查找外部的pull requests信息，测试已做相关设置，确保Devin无法访问相关信息，并且在此过程中也已人工手动检查了Devin运行情况。

AI程序员Devin卧底工作群修bug！和CTO聊技术，

最后团队强调Devin仍处于起步阶段，还有很大改进空间：

AI程序员Devin卧底工作群修bug！和CTO聊技术，

更多细节感兴趣的家人们可查看报告详情。

Devin发布不到一周，网友们的讨论已十分热烈。

比如，这位大兄弟表示自己一年前担心的事儿终究还是发生了。

以后Stack Overflow上都是各种Devin在提问，人，就只能被挤出去（Stack Overflow危！！！）：

AI程序员Devin卧底工作群修bug！和CTO聊技术，

有网友回应（手动狗头）：

它们可以互相回答问题。

AI程序员Devin卧底工作群修bug！和CTO聊技术，

还有网友发现Devin背后团队Cognition正在招全职软件工程师，于是缓缓打出一个问号：

Devin不是应该填补这些职位空缺来为他们省钱吗？

AI程序员Devin卧底工作群修bug！和CTO聊技术，

最后，若Devin公开你会想用它干点啥？

参考链接：
[1]https://www.cognition-labs.com/post/swe-bench-technical-report
[2]https://x.com/raunakdoesdev/status/1769066769786757375
[3]https://twitter.com/emollick/status/1768742585122558063
[4]https://x.com/mckaywrigley/status/1767985840448516343
[5]https://x.com/maisaAI_/status/1768657114669429103?s=20

Devin

梦晨

AI程序员Devin卧底工作群修bug！和CTO聊技术，”顶级码农水平”

Devin更多实测结果

复现Devin计划ing

Devin基准测试技术报告发布

相关阅读

开源版“Devin”AI程序员炸场：自己分析股票、做报表、建模型

热门文章

又一开源AI神器！将机器学习论文自动转为可运行代码库

全栈AI基础设施支撑，跑出全球首个开放使用视频生成DiT模型

人人可用的超级智能体！100+MCP工具随便选，爬虫小红书效果惊艳

Qwen3真香！通义App满血接入，一手实测在此

当购物用上大模型！阿里妈妈首发世界知识大模型，破解推荐难题