Agent 评测沙箱:AgentENV 如何用 Firecracker + overlaybd + ublk 把环境启动压到 50ms

发布时间:2026/10/4 22:42:54

Agent 评测沙箱:AgentENV 如何用 Firecracker + overlaybd + ublk 把环境启动压到 50ms 大规模跑 agent 评测和 RL 训练时沙箱是最先卡住的基础设施容器隔离不够agent 代码带 root 权限跑内核共享面太大KVM 整机启动秒级太慢镜像全量预推到几百台机器上直接打爆带宽和磁盘。MoonshotAI 在 2026-07 开源的 AgentENVkvcache-ai/AgentENVRust Go三周 3.2K star给的答案是把三件事拧在一起Firecracker microVM 做隔离、overlaybd 做镜像/快照懒加载、快照 fork 做环境复用。它是 Kimi K3 agentic RL 训练背后的环境平台生产环境跑过 150 万镜像单机内存超卖 9.6x。这篇文章从源码拆它的控制面、存储子系统和快照流水线再落到部署配置和测试团队的接入建议。控制面axum OpenAPI 生成路由外加一个手写反向代理单节点上 AgentENV 是三层HTTP APIaxum→ orchestrator生命周期管理→ Firecracker VM。API 路由大部分由 OpenAPI 生成agentenv_http_servercrate手写部分只有/proxy/*反向代理——沙箱内 agent 起的 HTTP 服务通过它暴露给外部代理按 sandbox_id 分类路由。Prometheus 指标挂在/metrics。多节点控制面在services/里是独立的 Go 模块两个组件GatewayHTTP 反向代理按 sandbox ID 路由到对应节点SchedulergRPC 服务负责节点选择、沙箱与节点的绑定、心跳、P2P 对端发现Scheduler 支持 static配置里的节点列表和 kuberneteswatch headless Service 的 EndpointSlices两种发现模式。K8s 部署模型值得抄gateway 是 Deployment ClusterIPscheduler 单副本agentenv-node是带/dev/kvm的 privileged DaemonSet——每个宿主机一个节点实例hostPath 挂本地缓存。生命周期LaunchPlan 三态 不透明的后端状态orchestrator 用LaunchPlan表达沙箱的创建来源pub enum CreateLaunchSource { Snapshot { snapshot: BoxRunnableSnapshot }, // 从已提交快照冷启 Fresh { build_spec: BoxFreshSandboxBuildSpec }, // 从模板现构建 } pub enum LaunchPlan { Create(BoxCreateLaunchPlan), // 过渡态 Creating Resume(BoxResumeLaunchPlan), // 过渡态 Resuming从 PausedSandboxState 恢复 }orchestrator 对沙箱后端只认SandboxBackendtraitPausedSandboxState对它是完全不透明的pause 时序列化成 JSON 存进 metadataresume 时原样交回后端orchestrator 不解释里面的任何字段。换后端envd/Firecracker、process、mock不需要动 orchestrator 一行代码——这是它能同时服务评测、RL 训练和本地开发三种场景的结构性原因。fork 也是 trait 上的一个操作SandboxForkSpec只带新的 sandbox_id 和访问令牌一个 running 环境可以 fork 成多个独立沙箱跑并行 agent 工作流。对评测来说这意味着同一环境状态可以低成本复制出 N 份并行度不再受环境启动成本限制。模板流水线aenv pull 到底做了什么aenv pull ubuntu:22.04 --name ubuntu不是简单拉镜像。它走 template builderbuild_spec描述 FROM 哪个 OCI 镜像 要执行的自定义步骤step_executor在沙箱里逐步执行构建装依赖、写配置产物 seal 成不可变的只读层集合注册成模板。之后每次aenv start从模板冷启或从某个已提交快照秒级恢复。模板是环境定义快照是环境状态两者分离是这套系统能复用的关键。存储子系统LSMT 分层镜像 ublk 用户态块设备真正硬核的部分在storage/四件事overlaybd 镜像格式是 LSMTLog-Structured Merge Tree分层的。每层文件头有 magicLSMT\0\1\2索引是一组 16 字节位压缩的DiskSegmentMapping50-bit 数据偏移、14-bit 长度、55-bit 物理偏移外加 zeroed 标记和层标签。底层是只读压缩层顶层一个可写 upper layer。读路径自顶向下查 segment index第一个命中的层出数据写全部 append 到 uppersync 时刷索引。压缩用 zstd level 3 随机访问跳表 CRC32C 校验。ublk 把镜像变成块设备。用户态进程通过 io_uring 的UringCmd向/dev/ublk-control发 ADD内核分配设备 ID 并创建/dev/ublkcN控制和/dev/ublkbN块设备块 I/O 通过 mmap 的ublksrv_io_desc数组派发给用户态 worker 处理。VM 里看到的是正经块设备但数据实际来自 overlaybd 懒加载层——没读到的块根本不会下载本地磁盘只是一个有界缓存。内存快照走同一条路。VM 内存被做成一个 ublk 只读块设备同一个快照 fork 出来的沙箱共享同一份内存镜像靠 refcount 管理生命周期。这是 9.6x 内存超卖的物理基础环境跑得越久越分化可回收的 guest 内存越多。ublk-daemon 独立进程。所有 ublk 设备由一个常驻 daemon 统一管理Unix socket RPC带 warm-pool 预分配设备创建开销不落在关键路径上。快照流水线seal 上层 → 变新底层 → 开新上层pause/快照的核心就一句话create_snapshot_and_restack()。把活的 upper layer seal 掉变成最新的只读层原地开一个新的可写 upper——整个增量快照 100ms。快照产物vm_state Firecracker manifest发布到 repositoryPosixFS共享目录/mnt/aenv-snapshots节点本地image-cache/commits/可随时回收已提交快照不 pin 本地层OSSS3 兼容对象存储提交后快照工件走 P2P 分发推到集群。P2P 层基于 iroh iroh-blobs对外是Arcdyn P2pTransporttraitlookup/fetch/publish/unpublish支持 byte-range fetch对端发现由 scheduler 的ListP2pPeers提供scheduler 不存工件、不转发数据。单节点部署直接 disabled 模式零开销。操作延迟说明boot / resume50ms快照冷启或从暂停恢复pause100ms释放 CPU/内存回主机增量快照100ms重磁盘修改下也成立评测接入模式fork 并行 快照复现对测试团队这套平台最值钱的用法是环境状态可版本化。评测回归可以固定在一个已提交快照上跑用例前 fork 出 N 个沙箱并行执行用例结束后整体丢弃下一轮回归还是从同一个快照出发——环境漂移被彻底排除比在 CI 里反复 docker build 可复现得多from e2b import Sandbox BASE eval-snapshot-v42 # 已提交的评测基准快照 results [] for i in range(16): # 16 路并行 sb Sandbox.create(BASE) # fork 自同一快照 r sb.commands.run(fpytest case_{i}.py -q) results.append((i, r.exit_code, r.stdout[-500:])) sb.kill() # 用完即弃不留状态配套的还有两个基础设施细节沙箱内服务通过/proxy/*反向代理暴露外部测试编排可以直接访问 agent 起的 HTTP 端口做黑盒断言每个节点的 Prometheus/metrics暴露环境启停、快照、P2P 传输指标——环境平台的健康度本身可观测。选型对比为什么不直接用 Docker 或 KVM维度Docker传统 KVMAgentENV隔离级别共享内核cgroup/namespace完整虚拟化Firecracker microVM启动延迟百 ms 级秒级50ms快照镜像分发全量拉取/预推全量overlaybd 懒加载内存密度高但隔离弱低快照共享 ballooning 9.6x状态复用无原生快照有但重增量快照 forkDocker 输在隔离agent 评测要防恶意代码共享内核面太大KVM 输在启动速度和镜像分发AgentENV 用 microVM 懒加载 快照把三个短板同时补上。实践部署配置和 E2B 兼容单机部署要求内核 6.8、/dev/kvminstall.sh 或 Docker--privileged -v /dev:/dev都行。共享存储配置懒加载的关键[snapshot] repository_backend posix_fs [backend.posix_fs] snapshot_store /mnt/aenv-snapshots [image.cache.remote_blocks] max_size_gb 100 # 本地磁盘是有界缓存热数据留存、冷数据驱逐OSS 后端把repository_backend换成oss并配 endpoint/bucket 即可。存储网络至少 1Gbps10Gbps 起步。E2B 兼容是最大的迁移红利API 层兼容 E2B现有 E2B 代码零改动切换export E2B_API_URLhttp://127.0.0.1:8000 export E2B_SANDBOX_URL${E2B_API_URL} export E2B_API_KEYe2b_000000from e2b import Sandbox, SandboxQuery, SandboxState sandbox Sandbox.create(template-id) # 从模板起沙箱 result sandbox.commands.run(pytest -q) # 沙箱内跑测试 sandbox.beta_pause() # 暂停释放资源 sandbox.kill()aenv CLI 同样够用aenv pull ubuntu:22.04 --name ubuntu、aenv start ubuntu、aenv pause/fork/timeout sandbox-id。踩坑清单目前无鉴权README 明确警告别暴露公网放可信内网或加授权代理无 KVM 的环境走 PVM 部署有专门 guide性能打折但能跑空闲环境 TTL 默认短长任务记得aenv timeout续期快照存 OSS 时注意跨 region 拉取延迟P2P 分发能缓解但别裸奔公网 OSS收尾AgentENV 值得抄的不是又一个沙箱平台而是三个工程决策镜像和内存统一走 overlaybd 懒加载 有界本地缓存让集群总镜像量超过单机磁盘几个数量级快照和 fork 作为一等公民把起环境从秒级操作变成 50ms 的廉价操作API 兼容 E2B迁移成本趋近于零。对测试团队来说这意味着评测环境可以做到从同一快照 fork 出 N 个并行沙箱跑同一组用例可复现性有保障空闲即 pause 释放资源成本可控agent 评测和 RL 训练共用一套环境平台基础设施复用。进阶方向agentic RL 训练的 on-policy 数据生产、评测用例在沙箱内的编排、把快照流水线接进 CI 做回归环境的版本化。
延伸阅读

更多相关文章

2026/10/4 22:25:17

在线HTTP接口测试工具ApiPost实战:从核心功能到高频错误排查

1. 项目缘起:为什么我们需要一个“好用”的在线HTTP测试工具?做后端开发、前端联调,或者搞点小爬虫、对接第三方API,谁还没跟HTTP请求打过交道呢?我干了这么多年,从最早用浏览器地址栏敲?keyvalue&#xf…

2026/9/30 7:20:57

SpringBoot+Vue企业人事管理系统:从架构设计到工程化部署全解析

如果你正在寻找一个既能作为毕业设计项目,又能直接用于实际企业管理的实战案例,那么一个功能完整、技术栈主流、附带源码和论文的“企业人事管理系统”无疑是一个绝佳的选择。但问题来了:网上开源项目众多,为什么这个基于SpringBo…

2026/10/5 5:47:23

MFC下使用C++操作Word:COM自动化完整指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 5:47:23

MR25H40CDF MRAM与STM32F732IE工业存储方案实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 5:47:23

海思Hi3559A与CV100的DDR4硬件协同配置原理

1. 项目概述:为什么Hi3559A/CV100的DDR4配置不是“填参数”而是“调电路”你手头有一块海思Hi3559A或CV100的开发板,芯片手册翻到第387页,DDR4控制器寄存器表密密麻麻列了62个字段;你照着某份“通用配置模板”改完时序参数&#x…

2026/10/5 5:47:23

深入理解LSTM隐含层初始化:每个Batch为何都要重置状态?

这两个Batch没有可比性,因为它们的语义单元完全不同。Batch是训练过程中为了计算效率和梯度稳定性而划分的样本组,它是一个纯粹的“训练维度”概念;而时间步是序列本身的结构维度,是样本内部的先后关系。把两个维度混在一起讨论初…

2026/10/5 5:47:23

NXP S32K144上PMSM无感FOC实战调参指南

1. 这不是教科书,是我在NXP开发板上烧了7块PMSM驱动板后写下的实操笔记你搜“PMSM无感FOC”时,大概率会撞进一堆术语迷宫:AMCLIB、状态观测器、反电动势估算、PLL锁相环、初始位置检测……这些词堆在一起,像一堵密不透风的墙。我刚…

2026/10/5 5:42:22

景区人流与外卖订单共振:藏在假期生活大数据里的真实消费热度

景区人流与外卖订单共振:藏在假期生活大数据里的真实消费热度十月四日下午四点,黄金周的长假进度条已经悄无声息地滑过了中点。 工位旁的英短猫 Null 正趴在窗台边,全神贯注地盯着窗外一只在玻璃上停留的灰鸽子,两只圆耳朵随着鸽子…

2026/10/4 0:01:02

Jev+Agent接管浏览器:browser-use实战与jev-ultrafast性能优化

1. 从“Jev”说起:为什么我要把Agent接进浏览器“Jev”这个词最近在圈子里出现的频率越来越高,很多人第一次听到会以为是某个新模型的名字,其实它更像是一种思路——把Jev模型的能力当作底座,通过Agent的方式去接管浏览器&#xf…

2026/10/4 0:01:02

多智能体集群实战:DeepAgents编排、MCP与A2A协议及Skills体系

1. 从"单兵作战"到"集群协同":多智能体编排到底在解决什么问题如果你最近在折腾 Agent 相关的东西,大概率会有一种感觉:单个 Agent 能做的事情,其实很快就摸到天花板了。你给它一个提示词,挂几个工…

2026/10/4 1:01:05

无源低通滤波器设计实战:从RC到LC,手把手教你避开那些坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑