发布时间:2026/8/17 3:08:06
Agent 评测沙箱:AgentENV 如何用 Firecracker + overlaybd + ublk 把环境启动压到 50ms 大规模跑 agent 评测和 RL 训练时沙箱是最先卡住的基础设施容器隔离不够agent 代码带 root 权限跑内核共享面太大KVM 整机启动秒级太慢镜像全量预推到几百台机器上直接打爆带宽和磁盘。MoonshotAI 在 2026-07 开源的 AgentENVkvcache-ai/AgentENVRust Go三周 3.2K star给的答案是把三件事拧在一起Firecracker microVM 做隔离、overlaybd 做镜像/快照懒加载、快照 fork 做环境复用。它是 Kimi K3 agentic RL 训练背后的环境平台生产环境跑过 150 万镜像单机内存超卖 9.6x。这篇文章从源码拆它的控制面、存储子系统和快照流水线再落到部署配置和测试团队的接入建议。控制面axum OpenAPI 生成路由外加一个手写反向代理单节点上 AgentENV 是三层HTTP APIaxum→ orchestrator生命周期管理→ Firecracker VM。API 路由大部分由 OpenAPI 生成agentenv_http_servercrate手写部分只有/proxy/*反向代理——沙箱内 agent 起的 HTTP 服务通过它暴露给外部代理按 sandbox_id 分类路由。Prometheus 指标挂在/metrics。多节点控制面在services/里是独立的 Go 模块两个组件GatewayHTTP 反向代理按 sandbox ID 路由到对应节点SchedulergRPC 服务负责节点选择、沙箱与节点的绑定、心跳、P2P 对端发现Scheduler 支持 static配置里的节点列表和 kuberneteswatch headless Service 的 EndpointSlices两种发现模式。K8s 部署模型值得抄gateway 是 Deployment ClusterIPscheduler 单副本agentenv-node是带/dev/kvm的 privileged DaemonSet——每个宿主机一个节点实例hostPath 挂本地缓存。生命周期LaunchPlan 三态 不透明的后端状态orchestrator 用LaunchPlan表达沙箱的创建来源pub enum CreateLaunchSource { Snapshot { snapshot: BoxRunnableSnapshot }, // 从已提交快照冷启 Fresh { build_spec: BoxFreshSandboxBuildSpec }, // 从模板现构建 } pub enum LaunchPlan { Create(BoxCreateLaunchPlan), // 过渡态 Creating Resume(BoxResumeLaunchPlan), // 过渡态 Resuming从 PausedSandboxState 恢复 }orchestrator 对沙箱后端只认SandboxBackendtraitPausedSandboxState对它是完全不透明的pause 时序列化成 JSON 存进 metadataresume 时原样交回后端orchestrator 不解释里面的任何字段。换后端envd/Firecracker、process、mock不需要动 orchestrator 一行代码——这是它能同时服务评测、RL 训练和本地开发三种场景的结构性原因。fork 也是 trait 上的一个操作SandboxForkSpec只带新的 sandbox_id 和访问令牌一个 running 环境可以 fork 成多个独立沙箱跑并行 agent 工作流。对评测来说这意味着同一环境状态可以低成本复制出 N 份并行度不再受环境启动成本限制。模板流水线aenv pull 到底做了什么aenv pull ubuntu:22.04 --name ubuntu不是简单拉镜像。它走 template builderbuild_spec描述 FROM 哪个 OCI 镜像 要执行的自定义步骤step_executor在沙箱里逐步执行构建装依赖、写配置产物 seal 成不可变的只读层集合注册成模板。之后每次aenv start从模板冷启或从某个已提交快照秒级恢复。模板是环境定义快照是环境状态两者分离是这套系统能复用的关键。存储子系统LSMT 分层镜像 ublk 用户态块设备真正硬核的部分在storage/四件事overlaybd 镜像格式是 LSMTLog-Structured Merge Tree分层的。每层文件头有 magicLSMT\0\1\2索引是一组 16 字节位压缩的DiskSegmentMapping50-bit 数据偏移、14-bit 长度、55-bit 物理偏移外加 zeroed 标记和层标签。底层是只读压缩层顶层一个可写 upper layer。读路径自顶向下查 segment index第一个命中的层出数据写全部 append 到 uppersync 时刷索引。压缩用 zstd level 3 随机访问跳表 CRC32C 校验。ublk 把镜像变成块设备。用户态进程通过 io_uring 的UringCmd向/dev/ublk-control发 ADD内核分配设备 ID 并创建/dev/ublkcN控制和/dev/ublkbN块设备块 I/O 通过 mmap 的ublksrv_io_desc数组派发给用户态 worker 处理。VM 里看到的是正经块设备但数据实际来自 overlaybd 懒加载层——没读到的块根本不会下载本地磁盘只是一个有界缓存。内存快照走同一条路。VM 内存被做成一个 ublk 只读块设备同一个快照 fork 出来的沙箱共享同一份内存镜像靠 refcount 管理生命周期。这是 9.6x 内存超卖的物理基础环境跑得越久越分化可回收的 guest 内存越多。ublk-daemon 独立进程。所有 ublk 设备由一个常驻 daemon 统一管理Unix socket RPC带 warm-pool 预分配设备创建开销不落在关键路径上。快照流水线seal 上层 → 变新底层 → 开新上层pause/快照的核心就一句话create_snapshot_and_restack()。把活的 upper layer seal 掉变成最新的只读层原地开一个新的可写 upper——整个增量快照 100ms。快照产物vm_state Firecracker manifest发布到 repositoryPosixFS共享目录/mnt/aenv-snapshots节点本地image-cache/commits/可随时回收已提交快照不 pin 本地层OSSS3 兼容对象存储提交后快照工件走 P2P 分发推到集群。P2P 层基于 iroh iroh-blobs对外是Arcdyn P2pTransporttraitlookup/fetch/publish/unpublish支持 byte-range fetch对端发现由 scheduler 的ListP2pPeers提供scheduler 不存工件、不转发数据。单节点部署直接 disabled 模式零开销。操作延迟说明boot / resume50ms快照冷启或从暂停恢复pause100ms释放 CPU/内存回主机增量快照100ms重磁盘修改下也成立评测接入模式fork 并行 快照复现对测试团队这套平台最值钱的用法是环境状态可版本化。评测回归可以固定在一个已提交快照上跑用例前 fork 出 N 个沙箱并行执行用例结束后整体丢弃下一轮回归还是从同一个快照出发——环境漂移被彻底排除比在 CI 里反复 docker build 可复现得多from e2b import Sandbox BASE eval-snapshot-v42 # 已提交的评测基准快照 results [] for i in range(16): # 16 路并行 sb Sandbox.create(BASE) # fork 自同一快照 r sb.commands.run(fpytest case_{i}.py -q) results.append((i, r.exit_code, r.stdout[-500:])) sb.kill() # 用完即弃不留状态配套的还有两个基础设施细节沙箱内服务通过/proxy/*反向代理暴露外部测试编排可以直接访问 agent 起的 HTTP 端口做黑盒断言每个节点的 Prometheus/metrics暴露环境启停、快照、P2P 传输指标——环境平台的健康度本身可观测。选型对比为什么不直接用 Docker 或 KVM维度Docker传统 KVMAgentENV隔离级别共享内核cgroup/namespace完整虚拟化Firecracker microVM启动延迟百 ms 级秒级50ms快照镜像分发全量拉取/预推全量overlaybd 懒加载内存密度高但隔离弱低快照共享 ballooning 9.6x状态复用无原生快照有但重增量快照 forkDocker 输在隔离agent 评测要防恶意代码共享内核面太大KVM 输在启动速度和镜像分发AgentENV 用 microVM 懒加载 快照把三个短板同时补上。实践部署配置和 E2B 兼容单机部署要求内核 6.8、/dev/kvminstall.sh 或 Docker--privileged -v /dev:/dev都行。共享存储配置懒加载的关键[snapshot] repository_backend posix_fs [backend.posix_fs] snapshot_store /mnt/aenv-snapshots [image.cache.remote_blocks] max_size_gb 100 # 本地磁盘是有界缓存热数据留存、冷数据驱逐OSS 后端把repository_backend换成oss并配 endpoint/bucket 即可。存储网络至少 1Gbps10Gbps 起步。E2B 兼容是最大的迁移红利API 层兼容 E2B现有 E2B 代码零改动切换export E2B_API_URLhttp://127.0.0.1:8000 export E2B_SANDBOX_URL${E2B_API_URL} export E2B_API_KEYe2b_000000from e2b import Sandbox, SandboxQuery, SandboxState sandbox Sandbox.create(template-id) # 从模板起沙箱 result sandbox.commands.run(pytest -q) # 沙箱内跑测试 sandbox.beta_pause() # 暂停释放资源 sandbox.kill()aenv CLI 同样够用aenv pull ubuntu:22.04 --name ubuntu、aenv start ubuntu、aenv pause/fork/timeout sandbox-id。踩坑清单目前无鉴权README 明确警告别暴露公网放可信内网或加授权代理无 KVM 的环境走 PVM 部署有专门 guide性能打折但能跑空闲环境 TTL 默认短长任务记得aenv timeout续期快照存 OSS 时注意跨 region 拉取延迟P2P 分发能缓解但别裸奔公网 OSS收尾AgentENV 值得抄的不是又一个沙箱平台而是三个工程决策镜像和内存统一走 overlaybd 懒加载 有界本地缓存让集群总镜像量超过单机磁盘几个数量级快照和 fork 作为一等公民把起环境从秒级操作变成 50ms 的廉价操作API 兼容 E2B迁移成本趋近于零。对测试团队来说这意味着评测环境可以做到从同一快照 fork 出 N 个并行沙箱跑同一组用例可复现性有保障空闲即 pause 释放资源成本可控agent 评测和 RL 训练共用一套环境平台基础设施复用。进阶方向agentic RL 训练的 on-policy 数据生产、评测用例在沙箱内的编排、把快照流水线接进 CI 做回归环境的版本化。

相关新闻

2026/8/17 3:08:06

在线HTTP接口测试工具ApiPost实战:从核心功能到高频错误排查

1. 项目缘起:为什么我们需要一个“好用”的在线HTTP测试工具?做后端开发、前端联调,或者搞点小爬虫、对接第三方API,谁还没跟HTTP请求打过交道呢?我干了这么多年,从最早用浏览器地址栏敲?keyvalue&#xf…

2026/8/17 3:08:06

SpringBoot+Vue企业人事管理系统:从架构设计到工程化部署全解析

如果你正在寻找一个既能作为毕业设计项目,又能直接用于实际企业管理的实战案例,那么一个功能完整、技术栈主流、附带源码和论文的“企业人事管理系统”无疑是一个绝佳的选择。但问题来了:网上开源项目众多,为什么这个基于SpringBo…

2026/8/17 4:13:09

数学建模实战:Matlab与Python程序代编核心技术与选型指南

1. 项目概述:数学建模与程序代编的实战价值在科研、竞赛和工程实践中,数学建模是一个将现实问题抽象为数学语言,并通过计算求解以指导决策的核心过程。无论是全国大学生数学建模竞赛,还是企业内部的流程优化、金融风险预测&#x…

2026/8/17 4:13:09

前端新闻页面实战:盒子模型与Flex布局详解

1. 新闻页面制作实战:从盒子模型到Flex布局刚入门前端时,新闻页面是我练习的第一个完整项目。这种内容密集型页面能系统训练HTML结构搭建和CSS布局能力,特别是盒子模型和Flex布局这两个核心概念。下面分享我制作新闻页面的完整思路和踩坑经验…

2026/8/17 4:13:09

网络设备配置与故障排查实战:从交换机VLAN到路由器防火墙

最近在排查一个网络问题时,发现团队里不少同学对网络设备的基础认知还停留在“交换机就是交换的,路由器就是路由的”这种模糊层面。当需要定位一个跨网段的访问延迟,或者分析一个VLAN内的广播风暴时,往往因为对设备工作原理和配置…

2026/8/17 4:08:08

KKCE: 网站测速平台,全球300+节点-快快测

一、引言:为什么配置了 HTTP/3,测速却显示 HTTP/2? 在升级 HTTP/3 时,我们通常会在服务器上启用 QUIC,并在响应头中添加 Alt-Svc: h3":443"。用 www.kkce.com 的 “网站测速”​ 测试,有时能看到…

2026/8/16 0:00:35

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/16 0:00:36

工业传感器与变送器详解:序章 从物理世界到工业数据

序章 从物理世界到工业数据 ——重新认识工业传感器与变送器 工业自动化系统正变得日益复杂。今天的工业现场早已不是简单的控制回路,而是由多层技术共同构成的立体体系:PLC、DCS、SCADA、MES、工业互联网、边缘计算与人工智能。控制系统可以执行复杂算法,工业网络可以实现…

2026/8/17 0:02:57

LabVIEW异步调用实战:解决界面卡顿与并行处理难题

1. 项目概述:为什么异步调用是LabVIEW进阶的必经之路如果你在LabVIEW里写过稍微复杂点的程序,尤其是涉及到界面响应、多任务并行或者硬件IO等待,大概率会遇到一个头疼的问题:程序“卡”住了。前面板点不动,进度条不更新…

2026/8/17 0:02:57

飞书局域网文件传输实战:3种方案实现高速点对点传输

1. 项目概述:为什么要在局域网内用飞书传文件? 飞书作为一款主流的协同办公套件,其核心功能是围绕云端协作设计的。无论是文档、表格还是文件,通常的分享逻辑都是“上传到云端 -> 生成链接 -> 分享给同事”。这个流程在互联…

2026/8/15 9:46:39

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/16 16:53:03

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/15 9:46:30

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…