autoresearch-mlx基准结果全解读:从2.667到1.294的val_bpb优化路径与硬件差异分析

发布时间:2026/10/11 23:09:17

autoresearch-mlx基准结果全解读:从2.667到1.294的val_bpb优化路径与硬件差异分析 【免费下载链接】autoresearch-mlxApple Silicon (MLX) port of Karpathys autoresearch — autonomous AI research loops on Mac, no PyTorch required.项目地址https://gitcode.com/gh_mirrors/au/autoresearch-mlx点击查看免费下载autoresearch-mlx是 Karpathy 提出的 autoresearchLLM 自主科研循环的 Apple Silicon / MLX 移植版无需 PyTorch 与 CUDA直接在 Mac 上用固定 5 分钟训练预算自动迭代train.py唯一目标是把val_bpb每字节比特数越低越好降到最低。本文完整解读其公开基准从 2.667 的基线一路压到 1.294并对比不同 Mac 硬件上的结果差异。一、项目是什么LLM 自己当研究员 autoresearch-mlx 的规则极简协议全文见 program.md元素说明唯一可改文件train.py —— 模型、优化器、训练循环随便改唯一指标val_bpb由 prepare.py 中只读的evaluate_bpb计算固定预算每次实验训练 5 分钟TIME_BUDGET 300见 prepare.py全程约 6–7 分钟决策规则跑完看val_bpb变低就keep变高就git reset回退然后无限循环一句话概括时间锁死硬件说了算——比的是谁能在 5 分钟里塞进更多有效优化步。二、公开优化路径2.667 → 1.808 的四次关键改动 results.tsv 记录了同一台 Mac 上从默认基线出发、逐条保留的本地行走路径Commitval_bpb内存(GB)状态改动383abb42.66700026.9keep基线AdamW默认配置c67ad2a2.69536926.9discard降低 weight decay 到 0.1失败回退909dd592.58890426.9keep总 batch 减半至2^164161af32.53372826.9keep矩阵学习率提到 0.045efc7aa1.80790220.7keep深度从 8 层砍到 4 层几个值得新手注意的细节中间有失败c67ad2a降 weight decay 反而变差被标记discard回退——这正是keep-or-revert机制的价值坏改动不会污染分支。降 batch 更多步数batch 减半后同样的 5 分钟里优化器多走了一倍多的步val_bpb 掉 0.078。最狠的一刀是砍深度8 层 → 4 层直接让 val_bpb 从 2.534 崩到 1.808-0.726内存还从 26.9GB 降到 20.7GB。这些最终值就固化在 train.py 的超参数区DEPTH 4、TOTAL_BATCH_SIZE 2**16、MATRIX_LR 0.04。 核心规律在固定墙钟时间下更小、训得快的模型能赢过更大的模型因为它能塞进更多优化步。这就是 Apple Silicon 移植反复验证出的模式。三、长程竞赛三台 Mac 的最优解与硬件差异 ️短跑只是热身。把循环挂整夜后README.md 中 Longer Apple Silicon runs 一节不同硬件跑出了明显不同的冠军配方机器当前最佳 val_bpb起点反复获胜的改动组合M4 Max #11.2945261.596971纯 AdamW、低矩阵 LR、3× MLP、去掉 logit cap、适中 weight decayM4 Max #21.3305091.807902更精简 batch、长退火anneal、SiLU、低正则、无 logit capMac Mini长跑1.3533291.922472Muon 优化器、更锐利的注意力、更小 MLP、更低标量 LR三个结论没有全局最优配方。两台同代 M4 Max 的最优组合都不相同——一台靠纯 AdamW 低矩阵 LR 3× MLP另一台靠长退火 SiLU 低正则。Mac Mini 找出了不同的路。小硬件上的最强改动偏向更激进的步数效率Muon、小 MLP、低标量 LR而不是简单复现 Max 机的配方。迁移性差正是价值所在。Mac Mini 的发现移植到 Max 基线上并不完全成立——这类硬件特化行为恰恰是自动循环擅长挖出来的东西。换硬件跑请先在自己机器上重建基线别直接套用别人的数字program.md 明确要求Do NOT use baseline numbers from other platforms。四、为什么一次运行的数字要打折看 单跑一次的 val_bpb 是有噪声的同一份train.py重跑结果会漂移约±0.03GPU 归约非确定性。而循环只保留比当前最优低的运行记录曲线其实是乐观的运行最小值——诚实复评时会回涨。所以项目提供了 rigor.py一个统计门槛替代看一眼差值就拍板多种子评分每个改动跑 3 个可配 5 个seed 取均值而非单次快照Bootstrap 置信检验只有当新配置确实更好的概率 P(better) ≥ 0.95 才keep快速淘汰第一个 seed 就明显劣于当前最优立刻丢弃不浪费后续 seed永不重复按train.py的哈希记账rigor_ledger.jsonl相同配置不重评uv run rigor.py run halve the batch size # 3 seed 评分 uv run rigor.py best # 查看当前最优 uv run rigor.py log # 全部已评分配置它只决策不改train.py、不碰 git、不动评测函数。对新手很友好——把循环交给严谨模式曲线才经得起复评。五、自己动手最快上手方法 ⚡前置Apple Silicon Mac Python 3.10 uvmlx、numpy、pyarrow、rustbpe、tiktoken。# 1. 安装依赖 uv sync # 2. 一次性准备数据 分词器存到 ~/.cache/autoresearch/ uv run prepare.py # 3. 跑一个 5 分钟实验得到你自己的基线 uv run train.py跑完会看到类似输出格式定义见 train.pyval_bpb: 2.534000 training_seconds: 312.4 peak_vram_mb: 27528.9 num_steps: 46 num_params_M: 50.3给新手的三条提醒只和你同一台机器的基线比别和本文数字或 NVIDIA 结果对比每次实验约 7 分钟睡觉前挂上醒来约 70 个实验按 8–9 个/小时估记结果用制表符分隔的 TSV描述里不要带逗号见 program.md 的 Logging results 一节。六、关键文件导航 文件角色README.md项目总览与全部公开基准数字program.md自主实验协议AI Agent 的操作手册train.py模型/优化器/训练循环唯一允许改的文件prepare.py数据、分词器、只读的evaluate_bpb评测勿改results.tsv实验历史账本rigor.py多种子 Bootstrap 的 keep/discard 统计门槛pyproject.toml依赖声明结语 autoresearch-mlx 用一组漂亮的数字说明了三件事5 分钟预算下小而快能打败大而慢2.667 → 1.808、不同 Mac 硬件会收敛到不同的最优配方1.294 / 1.331 / 1.353、单次运行的数字必须用统计门槛过滤噪声rigor.py。如果你想在自己机器上验证这套流程从uv run prepare.py开始半小时后就能拥有属于你的基线数字。赞分享【免费下载链接】autoresearch-mlxApple Silicon (MLX) port of Karpathys autoresearch — autonomous AI research loops on Mac, no PyTorch required.项目地址https://gitcode.com/gh_mirrors/au/autoresearch-mlx点击查看免费下载相关推荐Autoresearch EvalsClaude Autoresearch 迭代结果分析协议全解析Autoresearch EvalsClaude Autoresearch 迭代结果分析协议全解析 Autoresearch 项目Claude AutoreAI 技能人工智能AI 评测开发工具microeco包与LEfSe分析结果差异解析及优化方案microeco包与LEfSe分析结果差异解析及优化方案 背景介绍 microeco是一个强大的R语言微生物组分析工具包它整合了多种微生物组数据分析方法其中科研生物信息学数据分析autoresearch-mlx的rigor.py用Bootstrap置信检验告别val_bpb噪声的终极方案autoresearch mlx的rigor.py用Bootstrap置信检验告别val_bpb噪声的终极方案 autoresearch mlx 是 Karp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/10/11 23:09:17

Android系统架构本质:动态契约体系与分层调试实战

1. 为什么“系统架构”不是一张PPT里的分层图,而是Android开发者的底层操作系统观很多人第一次看到“Android系统架构”这个词,下意识会去翻官方文档里那张经典的四层图:Linux内核层、硬件抽象层(HAL)、运行时与框架层…

2026/10/11 23:09:17

N100迷你主机Linux日志排查:dmesg与journald实战指南

最近在调一台N100处理器的迷你主机,上面跑的是一个基于Linux的嵌入式定制系统,我习惯叫它EOS(Embedded Operating System)。EOS的日志默认走journald,同时dmesg里也能看到内核启动信息。最初我只是觉得这台机器启动比之…

2026/10/11 23:09:17

BIOS设置不生效?四类根因与排查方法全解析

1. 问题现象与排查思路总览BIOS里改完配置,保存重启,进系统一看——参数还是老的。这种事儿我在不同平台上都遇到过,从消费级主板到工控机、服务器准系统,症状看起来一模一样,根因却可能差了十万八千里。很多人第一反应…

2026/10/12 0:14:22

claude-mem实战:用SQLite+向量检索为AI助手构建长期记忆层

先说一个让人抓狂的场景:你在对话框里花二十分钟描述一个模块的重构思路,AI 给出了相当具体的实现方案,还帮你理清了依赖关系。第二天你打开同一个会话,发现它已经忘了你是谁、昨天讨论的接口叫 lark-core 还是 core-lark。你只能…

2026/10/12 0:14:22

2025年AI编程工具实测:Claude Code与Cursor的TaoToken接入配置对比

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/12 0:09:22

Vue打包工具与脚手架实战:从Webpack配置到TaoToken统一Key接入

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 0:02:13

Python调用Gemini Structured Outputs实现工单路由门禁

客服工单最怕的不是模型“答错一句话”,而是它给出一段看起来合理的说明,程序却从中猜错优先级。通俗做法是:要求模型只交 JSON(JavaScript Object Notation,轻量数据格式),再让代码验证它。Gem…

2026/10/11 0:02:13

Spring Boot超市进销存系统毕设实战:从需求拆解到答辩通关

最近带的一个学生项目组里,有A同学跑来问我:选什么毕设题目最稳妥,既能让评审老师觉得工作量够,又不会在答辩时被问到语无伦次。我第一反应就是推荐基于Spring Boot的超市仓库管理系统——也就是超市进销存系统。这个题目乍一看平…

2026/10/11 0:02:13

Flutter StatefulWidget 生命周期核心解析

很多刚开始接触 Flutter 的朋友,在看完一堆“Hello World”和基础组件之后,大概率都会撞上同一堵墙:StatefulWidget 里那堆 initState、build、dispose 方法,到底什么时候被调用?为什么顺序是那样?在里面到…

2026/10/12 0:04:22

绝缘子缺陷检测数据集清洗与工业级训练实战指南

简介:本资源是面向电力AI研发人员、工业视觉工程师及智能巡检系统开发者的绝缘子缺陷检测专用YOLO格式数据集,解决无人机航拍场景下绝缘子破损、污闪、积雪等9类典型缺陷的精准识别与定位难题。数据集共2139张真实巡检图像(含训练/验证/测试集…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑