[新闻] AI程式设计师Devin卧底工作群修bug!和CTO

楼主: jackliao1990 (jack)   2024-03-18 20:22:41
AI程式设计师Devin卧底工作群修bug! 和CTO聊技术,”顶级码农水平”
https://www.qbitai.com/2024/03/128338.html
梦晨
Agent的ChatGPT时刻
首个AI程式设计师 Devin ,现身明星新创公司内部群。
为解决一个技术问题,Devin借用了其创造者的帐号, 与客户公司的CTO交流 ,并根据回
应调整了代码方案。
对话之专业,围观者看了直呼这个世界太疯狂。
https://tinyurl.com/5n7zpdnf
事情发生在办公室软件Slack,截图中的akshat是AI基础设施新创公司 Modal Labs 的
CTO Akshat Bubna 。
Modal Labs也是Devin开发商Cognition的首批客户之一。
此时Devin正披着他的创造者之一、IOI金牌得主 Steven Hao 的马甲。
对话的开始,AI程式设计师Devin正在询问有关Modal Lab平台的密钥的生命周期问题,特
别是密钥更新后传播到正在运行的应用程式所需的时间。
Devin表示 自己已经查阅了文档 ,包括金钥和环境变量指南、CLI指令参考、API参考以
及容器生命周期钩子和参数, 但依旧没有找到关于金钥传播时间的明确资讯 。
Devin询问了更新的金钥通常需要多长时间才能被运行中的应用程式使用,因为这对于他
们的营运至关重要, 了解这一点将有助于管理他们的部署流程 。
人类CTO解释说,当金钥更新时,他们不会使已经运行的Modal容器失效,但是新启动的容
器将会读取更新后的值。
Devin对此表示感谢,并 决定暂时采用手动方法来管理Modal中的金钥,即在需要时呼叫
modal deploy指令来触发相关应用程式容器的重新启动 。
看完整个过程后,同样是AI创业家的Raunak Chowdhuri评价到:
发现问题、创建工单、调整程式码,最好的人类开发者就是这么工作的。
Devin更多实测结果
拿到Devin早期测试资格的人和公司不多,不过还是陆陆续续有人晒出实测结果。
热衷AI的华顿商学院教授 Ethan Molick 试过后,认为其新颖的即时互动方式是最值得关
注的。
您可以随时与它“交谈”,就像与人交谈一样,它会在后台不断地执行和调试您的想
法。
在测试中,Ethan Mollick要求Devin开发一个解释“新创公司融资中的股权稀释”的网站

不过他透露,AI还无法在没有任何帮助的情况下,自主且无错误地完成这项工作。
要想把一个重大项目交给人工智能来完成,还有很长的路要走,但这仍然是一个令人
着迷的开始。
另一位晒出测试过程的创业家 Mckay Wrigley 则更激动一些。
在他晒出的27分钟测试中,只发了一个GitHub连接,让Devin部署来自开源专案的程式码

Devin 自主把任务拆解成一系列子步骤 ,一步一步开始执行。
执行过程中,Devin在安装Supabase数据库时遇到了障碍, 自己打开了对应的Github仓库
开始查阅文件 …
从后续终端回馈可以看出,Devin查到了运行Supabase所需的各种连接埠和密匙都应该填
什么。
(装过的都知道,雀食挺麻烦……)
同时,Devin也正在 根据实际情况不断修改自己的后续计画 。
一段时间过后,一个本地的聊天机器人程式就跑起来了。
测试一段时间后Mckay Wrigley认为, Devin已经可以算Agent的ChatGPT时刻。
复现Devin计划ing
Devin这边大伙还在接连测试,另一边开源“复现”方案也在进行中…
这不,GitHub三万Star专案 MetaGPT 就上新了“开源版Devin”。
名为 资料解释器 (Data Interpreter):
和Devin一样,Data Interpreter也能实现自主编程,能迭代式观察数据,预测分析病情
进展、机器运作状态;还能建构机器学习模型、进行数学推理、自动回复电子邮件、仿写
网站…
例如从英伟达股价数据分析收盘价格趋势:
https://tinyurl.com/4h8xkfsx
分析数据预测葡萄酒品质:
https://tinyurl.com/479u8adk
除此之外,阿里Qwen成员Binyan Hui等人开启了 OpenDevin 项目,刚起步已获得1.2k
Star。
Binyan Hui发推文表示,已有一个初步的路线图和一群优秀的人在努力工作,在很短的时
间内就完成了前端原型。
同时专案团队也在招募新成员:
https://tinyurl.com/4zp34x9d
另外,也有一个名为Maisa AI的团队推出了 Maisa KPU (Knowledge Processing Unit)
,被网友认为与Devin有一些竞争。
目前Maisa KPU处于测试阶段,它可以解决复杂问题和推理,团队发布的基准测试结果如
下:
https://tinyurl.com/y6k7k99w
根据demo展示,KPU可以成为“智慧客服”,在客户没有正确写好订单号码的情况下,帮
助客户解决订单未送达的问题:
https://tinyurl.com/3pt7t759
Devin基准测试技术报告发布
最近,Devin创始团队Cognition也发布关于SWE-bench测试的技术报告。
除了先前已公布的测试结果之外,团队还透露了一些新消息。
例如,Cognition的目标之一是让Devin这个专门从事软件开发的AI智能体能够成功地为大
型、复杂的程式码库贡献程式码。
选择在SWE-bench上端到端运行智能体,也是考虑了它更接近现实世界的软件开发。
此外,研发团队还透露,为了防止Devin在测试中作弊,例如查找外部的pull requests信
息,测试已做相关设置,确保Devin无法访问相关信息,并且在此过程中也已人工手动检
查了Devin运行情况。
最后团队强调Devin仍处于起步阶段,仍有很大进步空间:
https://tinyurl.com/42amb7wc
更多细节有兴趣的家人们可查看报告详情。
Devin发布不到一周,网友们的讨论已十分热烈。
例如,这位大兄弟表示自己一年前担心的事儿终究还是发生了。
以后Stack Overflow 都是各种Devin在提问,人,就只能被挤出去 (Stack Overflow危
!!!)
有网友回应 (手排狗头) :
它们可以互相回答问题。
还有网友发现Devin背后团队Cognition正在招募全职软件工程师,于是缓缓打出一个问号

Devin不是应该填补这些职缺来为他们省钱吗?
最后,若Devin公开你会想用它干点啥?
参考连结:
[1]https://www.cognition-labs.com/post/swe-bench-technical-report
[2]https://x.com/raunakdoesdev/status/1769066769786757375
[3]https://twitter.com/emollick/status/1768742585122558063
[4]https://x.com/mckaywrigley/status/1767985840448516343
[5]https://x.com/maisaAI_/status/1768657114669429103?s=20

Links booklink

Contact Us: admin [ a t ] ucptt.com