发布时间:2026/8/27 15:38:31
TheAgentCompany解读:175个真实世界任务检验AI Agent能否胜任“数字员工” TheAgentCompany解读175个真实世界任务检验AI Agent能否胜任“数字员工”【免费下载链接】TheAgentCompanyAn agent benchmark with tasks in a simulated software company.项目地址: https://gitcode.com/gh_mirrors/th/TheAgentCompanyTheAgentCompany 是一个专门评测 AI AgentAI 智能体的开源基准benchmark它在本地模拟出一家完整的软件公司内置 175 个真实世界办公任务从写代码、看考勤到对账报销一应俱全用来检验 AI Agent 能否像数字员工一样自主完成工作。如果你的目标是快速了解这个项目是什么、怎么跑起来、任务如何评分这篇解读会给你一份完整地图。 一句话看懂把整个公司搬进 Docker现有 AI Agent 评测大多停留在查天气、订机票这类日常场景无法考察真正的专业工作。TheAgentCompany 的思路是造一家真实的公司让员工来上班。这家公司由 4 个自托管服务组成全部预置了业务数据服务用途对应真实场景GitLab代码托管与项目管理工程师的代码世界Plane项目/Issue 管理产品与研发的看板ownCloud云盘与办公文档共享文件仓库RocketChat即时通讯和同事聊天沟通这些服务都可以通过 servers/README.md 查看说明。对测试者来说最大的惊喜是一条命令就能把整家公司搭起来。官方提供了 setup.sh 脚本几分钟内自动拉取镜像并启动全部服务约需 30GB 磁盘空间详细排错指南在 docs/SETUP.md。 175个任务覆盖6类职场角色基准的核心是 175 个任务每个任务都来自真实职场工作。按角色前缀命名一眼就知道考谁sde-软件工程师修 bug、写单元测试、跑 CI 流水线、排查崩溃的服务器pm-产品经理在 Plane 和 GitLab 之间同步 Issue、安排会议、发通知ds-数据科学家修表格、写 SQL、建数据库、做预测模型hr-人力资源核对考勤、筛简历、整理人才档案finance-财务发票匹配、预算差异分析、报销审核admin-行政安排会议室、翻译销售群聊、删 PDF 页面所有任务的定义都放在 workspaces/tasks/ 目录下。看几个真实任务描述你就能体会什么叫数字员工级别的考题——最简单的如在 #general 频道发一条含Hi和飞吻表情、并 活跃用户的消息workspaces/tasks/pm-send-hello-message/task.md硬核的如阅读内部维基、克隆 API 服务器仓库并在本地跑起来然后问 Alex Turner 接下来该自我介绍给谁workspaces/tasks/example/task.md。还有更微妙的能力要求与 LLM 驱动的 NPC 同事多轮沟通、跨系统搬运信息、处理图像与数学推理——这些能力在纯网页浏览基准里根本测不到。 评分机制结果导向 过程检查点一个基准的可信度取决于打分方式。TheAgentCompany 采用双层评分结果评测主分直接验证最终状态是否符合要求如服务器是否真的跑起来了子检查点副分复杂任务沿路设置可验证的检查点给部分分partial credit每个任务目录是一个标准化试卷包结构见 workspaces/README.mdtask.md— 题目本身唯一允许给 Agent 看的文件evaluator.py— 评分函数加密存放防止 Agent 偷看答案checkpoints.md— 人工可读的评分标准说明dependencies.yml— 该任务依赖哪些服务评分器混合了两种实现确定性程序验证精确可靠 LLM 评审处理开放性产出。评测入口在 evaluation/run_eval.py完整流程文档见 docs/EVALUATION.md。 新手上手4步完成一次 AI Agent 考试第 1 步搭建公司运行 servers/setup.sh看到 All services are up and running! 即就绪。第 2 步启动任务容器每个任务都是一个 Docker 镜像docker run拉起来。第 3 步出题给 Agent初始化环境后只需一句提示词——Complete the task in /instruction/task.md——你的 Agent 就开始上班了。第 4 步自动判卷任务结束后运行/utils/eval.py传入 Agent 的操作轨迹即可得到 JSON 成绩单轨迹还可用于计算部分得分。如果配合 OpenHands 平台整个流程可一条命令批量跑完 175 题详见 evaluation/README.md。 为什么这个基准值得关注对企业AI 是否真能接管工作流直接影响采购与人力规划这个基准给出的正是上岗实测数据对开发者它是可复现、可扩展的框架加新任务只需几分钟欢迎贡献对研究者支持多 Agent 交互、多模态观察截图/DOM/API等多种设定对比一句话总结TheAgentCompany 用 175 道职场真题回答了一个严肃问题——AI Agent 离真正取代一份工作还差多远。打开 docs/README.md 开始你的第一次招聘实测吧。【免费下载链接】TheAgentCompanyAn agent benchmark with tasks in a simulated software company.项目地址: https://gitcode.com/gh_mirrors/th/TheAgentCompany创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026/8/27 15:33:30

人工智能基础概念我重学了三遍:监督学习、无监督学习、强化学习到底怎么选

人工智能基础概念我重学了三遍:监督学习、无监督学习、强化学习到底怎么选 换岗第二天,组长甩给我两个 CSV 和一句话:“你看看用哪种学习能把这个退款预测准,下午对一下思路。”我坐在工位上盯着十几列订单特征,脑子里只反复回响三个词--监督、无监督、强化--全是书上的概念,没…

2026/8/27 16:28:41

Kimi K3 8GB内存本地部署实战:量化、参数调优与避坑指南

Kimi K3 能不能在 8GB 内存的机器上本地部署?先说结论:能跑,但只能跑量化压缩后的小体积版本,而且要把任务类型、上下文长度、并发数全部压到很保守的范围。如果目标是完整版大模型,那 8GB 内存连权重都放不下&#xf…

2026/8/27 16:28:41

Qwen-VL多模态大模型LoRA微调实战:从原理到部署

简介:大语言模型(LLM)的微调是将其适配到特定领域任务的关键技术。其核心原理是通过调整模型参数,使其在保留通用知识的同时,学习特定数据的分布。LoRA(Low-Rank Adaptation)作为一种高效的参数…

2026/8/27 16:28:41

RepVGG:通过重参数化实现训练复杂与推理高效的CNN架构设计

1. 从“多分支”到“单路”:RepVGG为何要“返璞归真” 如果你在2020年前后关注过计算机视觉领域,尤其是图像分类和检测任务,可能会对当时一个“反直觉”的现象印象深刻:大家都在追求更复杂、更深层的网络结构,比如ResN…

2026/8/27 16:23:40

PaperTodo 快速上手:10 分钟把今天的待办贴到桌面

PaperTodo 快速上手:10 分钟把今天的待办贴到桌面 【免费下载链接】PaperTodo 极简 Windows 桌面便签工具。让桌面上有几张安静、可用、不会打扰人的纸。WPF 原生,支持待办与 Markdown。——A minimalist Windows desktop sticky note tool. It puts a f…

2026/8/26 9:13:28

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/27 10:58:22

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/27 7:46:21

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/27 0:01:16

Go语言构建企业级AI服务网关:统一管理英伟达等AI接口调用

1. 项目概述:从零构建一个企业级的AI服务网关 最近在帮一个做内容审核的团队做技术架构升级,他们原来的业务里,每天有几十万张图片和短视频需要过审,最初是接了几个开源的AI模型自己部署,但效果和性能一直不太稳定。后…

2026/8/27 0:01:16

LeetCode Hot100(51-60)算法精解与面试技巧

1. 题目背景与核心价值"hot100(51-60)"这个标题看起来像是某个编程题库或算法练习集中的一组题目编号。在技术社区中,类似命名通常指向LeetCode、牛客网等平台的热门题目集合。作为刷过300题的算法老手,我理解这类题目的核心价值在于&#xff…

2026/8/27 0:01:16

CRC校验实战:从模2除法到HJ212协议排错

1. 为什么一个“校验码”能扛住工业现场90%的数据 corruption? 你有没有遇到过这样的场景:嵌入式设备通过RS-485上传温湿度数据,上位机偶尔收到一帧乱码——温度显示成-273℃,湿度跳到999%,但串口波形看起来完全正常&a…

2026/8/26 19:34:06

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/26 19:17:08

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/26 19:34:05

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…