您的位置:首页 > 互联网

ai程序员是什么「AI程序员Devin卧底工作群修bug!和CTO聊技术,网友:顶级码农水平」

发布时间:2024-03-18 12:53:47  来源:互联网     背景:

声明:本文来自于微信公众号 量子位(ID:QbitAI),作者:量子位,授权转载发布。

首个AI程序员Devin,现身明星创业公司内部群。

为解决一个技术问题,Devin借用了其创造者的账号,与客户公司的CTO交流,并根据回复调整了代码方案。

对话之专业,围观者看了直呼这个世界太疯狂。

事情发生在办公软件Slack,截图中的akshat是AI基础设施创业公司Modal Labs的CTO Akshat Bubna。

Modal Labs也是Devin开发商Cognition的首批客户之一。

此时Devin正披着他的创造者之一、IOI金牌得主Steven Hao的马甲。

对话的开始,AI程序员Devin正在询问有关Modal Lab平台的密钥的生命周期问题,特别是密钥更新后传播到正在运行的应用程序所需的时间。

Devin表示自己已经查阅了文档,包括密钥和环境变量指南、CLI命令参考、API参考以及容器生命周期钩子和参数,但依旧没有找到关于密钥传播时间的明确信息。

Devin询问了更新的密钥通常需要多长时间才能被运行中的应用程序使用,因为这对于他们的运营至关重要,了解这一点将有助于管理他们的部署流程。

人类CTO解释说,当密钥更新时,他们不会使已经运行的Modal容器失效,但是新启动的容器将会读取更新后的值。

Devin对此表示感谢,并决定暂时采用手动方法来管理Modal中的密钥,即在需要时调用modal deploy命令来触发相关应用程序容器的重启。

看完整个过程后,同样是AI创业者的Raunak Chowdhuri评价到:

发现问题、创建工单、调整代码,最好的人类开发者就是这么工作的。

Devin更多实测结果

拿到Devin早期测试资格的人和公司并不多,不过还是陆陆续续有人晒出实测结果。

热衷AI的沃顿商学院教授Ethan Molick试过后,认为其新颖的实时交互方式是最值得关注的。

您可以随时与它“交谈”,就像与人交谈一样,它会在后台不断地执行和调试您的想法。

在测试中,Ethan Mollick要求Devin开发一个解释“创业公司融资中的股权稀释”的网站。

不过他透露,AI还无法在没有任何帮助的情况下,自主且无差错地完成这项工作。

要想把一个重大项目交给人工智能来完成,还有很长的路要走,但这仍然是一个令人着迷的开始。

另一位晒出测试过程的创业者Mckay Wrigley更激动一些。

在他晒出的27分钟测试中,只发了一个GitHub连接,让Devin部署来自开源项目的代码。

Devin自主把任务拆解成一系列子步骤,并一步步开始执行。

执行过程中,Devin在安装Supabase数据库时遇到了障碍,自己打开了对应的Github仓库开始查阅文档……

从后续终端反馈中可以看出,Devin查到了运行Supabase所需的各种端口和密匙都应该填什么。

(装过的都知道,雀食挺麻烦……)

与此同时,Devin还在根据实际情况不断修改自己的后续计划。

一段时间过后,一个本地的聊天机器人程序就跑起来了。

ai程序员是什么

测试一段时间后Mckay Wrigley认为,Devin已经可以算Agent的ChatGPT时刻。

复现Devin计划ing

Devin这边大伙还在接连测试,另一边开源“复现”方案也在进行中……

这不,GitHub三万Star项目MetaGPT就上新了“开源版Devin”。

名为数据解释器(Data Interpreter):

同Devin一样,Data Interpreter也能实现自主编程,能迭代式观察数据,预测分析病情进展、机器运行状态;还能构建机器学习模型、进行数学推理、自动回复电子邮件、仿写网站……

比如从英伟达股价数据中分析收盘价格趋势:

分析数据预测葡萄酒质量:

oppo明星营销

除此以外,阿里Qwen成员Binyan Hui等人开启了OpenDevin项目,刚刚起步已获得1.2k Star。

Binyan Hui发推文表示,已有一个初步的路线图和一群优秀的人在努力工作,在很短的时间内就完成了前端原型。

同时项目团队也在招新成员:

苹果ipad被盗

另外,还一个名为Maisa AI的团队推出了Maisa KPU(Knowledge Processing Unit),被网友认为与Devin有一些竞争。

目前Maisa KPU处于测试阶段,它可以解决复杂问题和推理,团队发布的基准测试结果如下:

根据demo展示,KPU可以成为“智能客服”,在客户没有正确写好订单号的情况下,帮助客户解决订单未送达的问题:

Devin基准测试技术报告发布

最近,Devin创始团队Cognition还发布关于SWE-bench测试的技术报告。

除了之前已公布的测试结果之外,团队还透露了一些新消息。

ai程序员是什么

比如,Cognition的目标之一是让Devin这个专门从事软件开发的AI智能体能够成功地为大型、复杂的代码库贡献代码。

选择在SWE-bench上端到端运行智能体,也是考虑了它更接近现实世界的软件开发。

此外,研发团队还透露,为了防止Devin在测试中作弊,比如查找外部的pull requests信息,测试已做相关设置,确保Devin无法访问相关信息,并且在此过程中也已人工手动检查了Devin运行情况。

最后团队强调Devin仍处于起步阶段,还有很大改进空间:

更多细节感兴趣的家人们可查看报告详情。

ai程序员是什么

Devin发布不到一周,网友们的讨论已十分热烈。

比如,这位大兄弟表示自己一年前担心的事儿终究还是发生了。

以后Stack Overflow上都是各种Devin在提问,人,就只能被挤出去(Stack Overflow危!!!):

有网友回应(手动狗头):

它们可以互相回答问题。

还有网友发现Devin背后团队Cognition正在招全职软件工程师,于是缓缓打出一个问号:

Devin不是应该填补这些职位空缺来为他们省钱吗?

最后,若Devin公开你会想用它干点啥?

参考链接:

[1]https://www.cognition-labs.com/post/swe-bench-technical-report

[2]https://x.com/raunakdoesdev/status/1769066769786757375

[3]https://twitter.com/emollick/status/1768742585122558063

[4]https://x.com/mckaywrigley/status/1767985840448516343

[5]https://x.com/maisaAI_/status/1768657114669429103?s=20


返回网站首页

本文评论
比OpenAI更快一步,最新开源的MiniGPT-4模型可让开发者提前感受GPT-4识图能力!
声明:本文来自于微信公众号 CSDN(ID:CSDNnews)),整理 |屠敏,授权转载发布。迄今为止,GPT-4凭借多模态能力已经成为 AI 领域备受关注的大模型,不过值得注意的是,OpenAI在推出 GPT-4时...
日期:04-19
但确认部分AI科学家迁至加拿大 微软亚洲研究院否认撤离中国
文 / 新喀鸦近期有传言称微软公司欲将其在中国设立的唯一研究机构——微软亚洲研究院(MSRA)撤离中国,转移到加拿大温哥华。根据界面新闻的消息显示,对于此问题,MSRA表示:此消息不...
日期:09-23
惊艳!华为P60概念图曝光_华为P60最新消息
近日,数码博主@RODENT950在国外社交平台上曝光了两张华为P60的概念图,图片显示背部设计和P50基本一致,令人意外的是,概念图显示P60似乎配备的类似iPhone14Pro系列的灵动岛式药丸...
日期:10-14
立讯精密2021年估值「立讯精密:预计2022年盈利95.45亿元至98.99亿元」
10月30日消息,立讯精密发布2022年年度业绩预告,预计2022年归属于上市公司股东的净利润为95.45亿元至98.99亿元,同比增长35%–40%;扣除非经常性损益后的净利润为92.19亿元至96.13...
日期:11-03
人工智能的新进展:GPT-4 Reflexion 准确度提高 30%
4月4日消息:即使不太可能会暂停六个月的人工智能研究,但似乎 GPT-4 也有能力实现巨大的飞跃,只要它认真审视一下自己。研究人员已经让 GPT 对自己的工作进行「反思(Reflexion)」...
日期:04-04
苹果iPhone 14太能吸金 128G升级256GB赚走90%利润「苹果32g升128需要多少钱」
在智能手机行业,苹果是标杆性的存在,虽然全球销量干不过三星,只能位居第二,然而他们一家就能赚走整个行业大部分利润,吸金能力爆表,苹果对赚钱的算计几乎体现在每个细节上,比如升级...
日期:10-04
加强学科建设,优化专业结构:KOOV为中国青少年编程教育发展助力(编程教育与学科融合)
  日前,教育部印发通知,公布了2020年度普通高等学校本科专业备案和审批结果,统计结果显示,新增备案专业数量最多的学科依然是人工智能。高校专业建设跟国家发展战略、国家人...
日期:07-16
三星推出12nm级32Gb DDR5 DRAM:业界首款及最高容量同类产品,年底量产
三星宣布,推出业界首款及最高容量的12nm级32Gb DDR5 DRAM。这是继三星今年5月开始量产12nm级16Gb DDR5 DRAM以后,扩大了其12nm级DRAM产品线,在相同封装尺寸下提供了翻倍的容量...
日期:09-01
最新高性价比笔记本「最新性价比高的笔记本」
近年来,随着科技的发展,笔记本电脑已成为人们日常工作和学习的必需品。然而,市面上的笔记本价格层出不穷,而每一款笔记本的性能和配置也各有千秋。在这样的情况下,如何选择一款性...
日期:05-31
蜜雪冰城们的瓶装水“混战”:讲水源、玩概念、掀起价格战_蜜雪冰城兑水
  文|《财瞭》;杨雪梅  夏天虽然过去了,但瓶装水的市场依然热闹。近日,蜜雪冰城在部分市场上市了“雪王爱喝水”瓶装水。天眼查信息显示,蜜雪冰城在瓶装水领域还申请了相关...
日期:09-26
链异构体「Statter Network:引领多链融合风潮,破解异构链兼容困局」
以太坊是首 个支持完全可编程的,去中心化应用智能合约的区块链,其不断增长的网络效应迅速推动了智能合约的广泛采用。智能合约最初在以太坊上得到应用,随后催生了诸如 Compound...
日期:01-25
iPhone热销背后是用户被绑架-罗永浩
来源:中关村在线近日,罗永浩表示,尽管iPhone 15的更新备受争议,但其依然能够热销,背后的原因在于用户被绑架。罗永浩认为,苹果的热卖关键在于用户被绑架,而iOS是主要的绑架者。 罗...
日期:09-18
俄罗斯的猫猫「俄罗斯一只猫和4岁儿童一样高:超过25斤 可能世界最大」
俄罗斯的尤利娅米尼娜有一只巨型宠物猫凯菲尔”,据她说这是世界上最大的猫。她上传的一段视频显示,在厨房里,凯菲尔直起身子趴在灶台上,和旁边她4岁的女儿几乎一样高,只是不清楚...
日期:07-29
育碧官宣:《阿凡达:潘多拉边境》开发完毕 12月7日正式发售_阿凡达:创建潘多拉世界 电影
快科技11月14日消息,今天育碧官方宣布《阿凡达:潘多拉边境》现已开发完毕,正式进入压盘阶段,并表示该游戏将于今年12月7日准时发售。速腾聚创上市公司同时官方还在推文中赞扬了...
日期:11-14
epic游戏喜加一「良心Epic喜加一!200块的3A大作《星球大战》正式免费送了」
一如上周预告,Epic商城今日起正式送出《星球大战: 战机中队》,时间截止到12月2日0点。同时,官方透露,下周开送的两款游戏分别是回合制奇幻战术游戏《凯旋堡(Fort Triumph)》和像素...
日期:11-28
贾跃亭再次被限制高消费 涉案为与西部证券合同纠纷_贾跃亭终身禁入证券市场
凤凰网科技讯9月28日消息,据天眼查App显示,近日,贾跃亭新增一则限制消费令信息,因贾跃亭未按执行通知书指定的期间履行生效法律文书确定的给付义务,被采取限制消费措施。涉及案件...
日期:09-30
ps3还值得入手吗_索尼PS3降价50美元  计划推出廉价PSP掌机
新快报讯 为了提升PS3销量,索尼本周二宣布将PS3价格调低50美元,到249.99美元。索尼在今年4月份遭遇大规模黑客攻击,大量用户个人信息被泄露,索尼因安全漏洞备受指责。就在年底...
日期:07-22
35岁的人何去何从「35岁,成年人的出路在哪里?」
声明:本文来自于微信公众号 十里村(ID:shilipxl),作者:村长住在十里村,授权转载发布。各位村民好,我是村长男人到了30岁,本来是成家、立业大展宏图的时候。但是不曾想,在当下,多数男...
日期:12-08
动视暴雪2022财年第四季度财报出炉:净利润狂跌29%「动视暴雪2020营收构成」
今天,动视暴雪公布了2022财年第四季度财报。财报显示,在第四季度,动视暴雪的净营收23.34亿美元,去年同期为21.63亿美元;净预定收入为35.7亿美元,去年同期为24.9亿美元。360集团周...
日期:02-07
三星One UI 6测试版曝光 或在下周发布_三星one ui 2.5新功能
7月12日 消息:根据最新报道,三星的One UI6测试版预计将在本月第三周首次亮相,这意味着首个测试版更新可能会在下周发布。其中,首个测试机型将是三星Galaxy S23系列。雷军说手机...
日期:07-12