梦晨 西风 发自 凹非寺量子位 | 公众号 QbitAI
首个AI程序员Devin,现身明星创业公司内部群。
为解决一个技术问题,Devin借用了其创造者的账号,与客户公司的CTO交流,并根据回复调整了代码方案。
对话之专业,围观者看了直呼这个世界太疯狂。
![adaf2edda3cc7cd9ead00c7477979632ba0e91c5.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/adaf2edda3cc7cd9ead00c7477979632ba0e91c5.jpeg@f_auto.jpg)
事情发生在办公软件Slack,截图中的akshat是AI基础设施创业公司Modal Labs的CTO Akshat Bubna。
Modal Labs也是Devin开发商Cognition的首批客户之一。
此时Devin正披着他的创造者之一、IOI金牌得主Steven Hao的马甲。
![242dd42a2834349b212e7502847ca2c337d3beb4.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/242dd42a2834349b212e7502847ca2c337d3beb4.jpeg@f_auto.jpg)
对话的开始,AI程序员Devin正在询问有关Modal Lab平台的密钥的生命周期问题,特别是密钥更新后传播到正在运行的应用程序所需的时间。
Devin表示自己已经查阅了文档,包括密钥和环境变量指南、CLI命令参考、API参考以及容器生命周期钩子和参数,但依旧没有找到关于密钥传播时间的明确信息。
Devin询问了更新的密钥通常需要多长时间才能被运行中的应用程序使用,因为这对于他们的运营至关重要,了解这一点将有助于管理他们的部署流程。
![7e3e6709c93d70cfb0acb032b64a660dbba12bda.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/7e3e6709c93d70cfb0acb032b64a660dbba12bda.jpeg@f_auto.jpg)
人类CTO解释说,当密钥更新时,他们不会使已经运行的Modal容器失效,但是新启动的容器将会读取更新后的值。
Devin对此表示感谢,并决定暂时采用手动方法来管理Modal中的密钥,即在需要时调用modal deploy命令来触发相关应用程序容器的重启。
![2cf5e0fe9925bc31ea28ebf110493abcca137082.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/2cf5e0fe9925bc31ea28ebf110493abcca137082.jpeg@f_auto.jpg)
看完整个过程后,同样是AI创业者的Raunak Chowdhuri评价到:
发现问题、创建工单、调整代码,最好的人类开发者就是这么工作的。
![730e0cf3d7ca7bcb40930677f39fdc6ef724a826.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/730e0cf3d7ca7bcb40930677f39fdc6ef724a826.jpeg@f_auto.jpg)
Devin更多实测结果
拿到Devin早期测试资格的人和公司并不多,不过还是陆陆续续有人晒出实测结果。
热衷AI的沃顿商学院教授Ethan Molick试过后,认为其新颖的实时交互方式是最值得关注的。
您可以随时与它“交谈”,就像与人交谈一样,它会在后台不断地执行和调试您的想法。
![45a883eaca884bdc75db79c25764e0cb AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/45a883eaca884bdc75db79c25764e0cb.gif)
在测试中,Ethan Mollick要求Devin开发一个解释“创业公司融资中的股权稀释”的网站。
不过他透露,AI还无法在没有任何帮助的情况下,自主且无差错地完成这项工作。
要想把一个重大项目交给人工智能来完成,还有很长的路要走,但这仍然是一个令人着迷的开始。
![35a85edf8db1cb132d2c3e6b90c2e14393584ba0.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/35a85edf8db1cb132d2c3e6b90c2e14393584ba0.jpeg@f_auto.jpg)
另一位晒出测试过程的创业者Mckay Wrigley更激动一些。
![2f738bd4b31c8701518d9a5168e929220608fff6.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/2f738bd4b31c8701518d9a5168e929220608fff6.jpeg@f_auto.jpg)
在他晒出的27分钟测试中,只发了一个GitHub连接,让Devin部署来自开源项目的代码。
![77c6a7efce1b9d16b95ce886bf4803828e5464e5.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/77c6a7efce1b9d16b95ce886bf4803828e5464e5.jpeg@f_auto.jpg)
Devin自主把任务拆解成一系列子步骤,并一步步开始执行。
![8b82b9014a90f6036d384b2077840416b151ed75.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/8b82b9014a90f6036d384b2077840416b151ed75.jpeg@f_auto.jpg)
执行过程中,Devin在安装Supabase数据库时遇到了障碍,自己打开了对应的Github仓库开始查阅文档……
![aec379310a55b319c1b57b710d3f352bcefc178d.png@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/aec379310a55b319c1b57b710d3f352bcefc178d.png@f_auto.jpg)
从后续终端反馈中可以看出,Devin查到了运行Supabase所需的各种端口和密匙都应该填什么。
(装过的都知道,雀食挺麻烦……)
![2cf5e0fe9925bc3149454b8011493abccb137035.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/2cf5e0fe9925bc3149454b8011493abccb137035.jpeg@f_auto.jpg)
与此同时,Devin还在根据实际情况不断修改自己的后续计划。
![3801213fb80e7bec136905e861b80e359a506baf.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/3801213fb80e7bec136905e861b80e359a506baf.jpeg@f_auto.jpg)
一段时间过后,一个本地的聊天机器人程序就跑起来了。
![c83d70cf3bc79f3d05d111e4f7377a1c738b2952.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/c83d70cf3bc79f3d05d111e4f7377a1c738b2952.jpeg@f_auto.jpg)
测试一段时间后Mckay Wrigley认为,Devin已经可以算Agent的ChatGPT时刻。
![eaf81a4c510fd9f99f9b62f768bb63272a34a4c7.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/eaf81a4c510fd9f99f9b62f768bb63272a34a4c7.jpeg@f_auto.jpg)
复现Devin计划ing
Devin这边大伙还在接连测试,另一边开源“复现”方案也在进行中……
这不,GitHub三万Star项目MetaGPT就上新了“开源版Devin”。
![42a98226cffc1e17f3903d760706410e728de9ea.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/42a98226cffc1e17f3903d760706410e728de9ea.jpeg@f_auto.jpg)
名为数据解释器(Data Interpreter):
![37d3d539b6003af32799d3367bbc71511138b6ec.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/37d3d539b6003af32799d3367bbc71511138b6ec.jpeg@f_auto.jpg)
同Devin一样,Data Interpreter也能实现自主编程,能迭代式观察数据,预测分析病情进展、机器运行状态;还能构建机器学习模型、进行数学推理、自动回复电子邮件、仿写网站……
比如从英伟达股价数据中分析收盘价格趋势:
![dba9587046c7e1f616f1b68fbad3871d AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/dba9587046c7e1f616f1b68fbad3871d.gif)
分析数据预测葡萄酒质量:
![4d4cfc98c93918e2785286a76051b4dc AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/4d4cfc98c93918e2785286a76051b4dc.gif)
除此以外,阿里Qwen成员Binyan Hui等人开启了OpenDevin项目,刚刚起步已获得1.2k Star。
![d53f8794a4c27d1e32a5e3f355431a63dcc438ae.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/d53f8794a4c27d1e32a5e3f355431a63dcc438ae.jpeg@f_auto.jpg)
Binyan Hui发推文表示,已有一个初步的路线图和一群优秀的人在努力工作,在很短的时间内就完成了前端原型。
同时项目团队也在招新成员:
另外,还一个名为Maisa AI的团队推出了Maisa KPU(Knowledge Processing Unit),被网友认为与Devin有一些竞争。
![5243fbf2b2119313165471cc28aebbda90238ddf.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/5243fbf2b2119313165471cc28aebbda90238ddf.jpeg@f_auto.jpg)
目前Maisa KPU处于测试阶段,它可以解决复杂问题和推理,团队发布的基准测试结果如下:
![0df3d7ca7bcb0a466f691cb626f541296a60af1e.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/0df3d7ca7bcb0a466f691cb626f541296a60af1e.jpeg@f_auto.jpg)
根据demo展示,KPU可以成为“智能客服”,在客户没有正确写好订单号的情况下,帮助客户解决订单未送达的问题:
Devin基准测试技术报告发布
最近,Devin创始团队Cognition还发布关于SWE-bench测试的技术报告。
除了之前已公布的测试结果之外,团队还透露了一些新消息。
![342ac65c10385343a73bb0e9de850773c88088a1.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/342ac65c10385343a73bb0e9de850773c88088a1.jpeg@f_auto.jpg)
比如,Cognition的目标之一是让Devin这个专门从事软件开发的AI智能体能够成功地为大型、复杂的代码库贡献代码。
选择在SWE-bench上端到端运行智能体,也是考虑了它更接近现实世界的软件开发。
此外,研发团队还透露,为了防止Devin在测试中作弊,比如查找外部的pull requests信息,测试已做相关设置,确保Devin无法访问相关信息,并且在此过程中也已人工手动检查了Devin运行情况。
![267f9e2f07082838805298ffea0f1e0c4d08f126.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/267f9e2f07082838805298ffea0f1e0c4d08f126.jpeg@f_auto.jpg)
最后团队强调Devin仍处于起步阶段,还有很大改进空间:
![023b5bb5c9ea15ce859774a9fb968dfe3b87b2bd.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/023b5bb5c9ea15ce859774a9fb968dfe3b87b2bd.jpeg@f_auto.jpg)
更多细节感兴趣的家人们可查看报告详情。
Devin发布不到一周,网友们的讨论已十分热烈。
比如,这位大兄弟表示自己一年前担心的事儿终究还是发生了。
以后Stack Overflow上都是各种Devin在提问,人,就只能被挤出去(Stack Overflow危!!!):
![aa18972bd40735fa499c5490d3c7b8be0e2408ca.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/aa18972bd40735fa499c5490d3c7b8be0e2408ca.jpeg@f_auto.jpg)
有网友回应(手动狗头):
它们可以互相回答问题。
![adaf2edda3cc7cd91315d6da74979632b80e9119.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/adaf2edda3cc7cd91315d6da74979632b80e9119.jpeg@f_auto.jpg)
还有网友发现Devin背后团队Cognition正在招全职软件工程师,于是缓缓打出一个问号:
Devin不是应该填补这些职位空缺来为他们省钱吗?
![aa64034f78f0f736825bbcd844c30414e9c413e1.jpeg@f_auto AI程序员Devin卧底工作群,修bug、与CTO聊技术,展现“顶级码农水平”](https://www.aigc.cc/wp-content/uploads/2024/03/aa64034f78f0f736825bbcd844c30414e9c413e1.jpeg@f_auto.jpg)
最后,若Devin公开你会想用它干点啥?
参考链接:[1]https://www.cognition-labs.com/post/swe-bench-technical-report[2]https://x.com/raunakdoesdev/status/1769066769786757375[3]https://twitter.com/emollick/status/1768742585122558063[4]https://x.com/mckaywrigley/status/1767985840448516343[5]https://x.com/maisaAI_/status/1768657114669429103?s=20
(来源:量子位)