AutoGluon 1.2.0 深度解析:TabPFNMix 表格基础模型、并行训练策略与 Chronos-Bolt 时序预测

发布时间:2026/9/16 0:04:09

AutoGluon 1.2.0 深度解析:TabPFNMix 表格基础模型、并行训练策略与 Chronos-Bolt 时序预测 AutoGluon 1.2.0 深度解析TabPFNMix 表格基础模型、并行训练策略与 Chronos-Bolt 时序预测【免费下载链接】autogluonFast and Accurate ML in 3 Lines of Code项目地址: https://gitcode.com/GitHub_Trending/au/autogluonAutoGluon 1.2.0 是该项目在 2024 年下半年发布的重要版本核心亮点包括Tabular 模块引入首个自研表格基础模型 TabPFNMix 与新的experimental_quality预设、全新的fit_strategyparallel并行训练策略TimeSeries 模块集成新一代基础预测模型 Chronos-Bolt 并补齐协变量回归器与微调能力同时新增 Python 3.12 支持、弃用 Python 3.8。本文基于官方发布说明并对照仓库源码逐项解析这些新特性的配置方式、底层实现与适用场景帮助读者理解如何在实际项目中使用这些能力。版本总览一次聚焦 Tabular 与 TimeSeries 的大版本更新官方发布说明指出AutoGluon 1.2 对 Tabular 和 TimeSeries 两大模块进行了大规模改进在基准评测中两者相对 AutoGluon 1.1 均达到70% 的胜率win-rate该版本包含186 个 commit、来自 19 位贡献者并新增 Python 3.12 支持、正式移除 Python 3.8 支持。需要特别强调的是官方发布说明中的一条重要兼容性声明Loading models trained on older versions of AutoGluon is not supported. Please re-train models using AutoGluon 1.2. 不支持加载旧版本 AutoGluon 训练的模型请使用 AutoGluon 1.2 重新训练。这意味着升级到 1.2.0 后历史模型文件无法直接加载需重新训练升级前应做好模型与预测结果的重建规划。此外官方还披露了 2024 年 AutoGluon 在 Kaggle 等竞赛平台上的使用情况在 18 场表格类 Kaggle 竞赛中取得 15 次前三名含 7 次第一名且从未跌出私有榜前 1%。需要说明的是这些成绩是在人类专家结合手工特征工程与超参调优的情况下取得的并非开箱即用的默认配置结果。本仓库的 AWESOME.md 收录了相关竞赛方案的整理链接。重点特性一TabularPredictor 新预设experimental_quality预设定义与源码配置experimental_quality是 1.2 为 TabularPredictor 新增的实验性预设目标是在预测质量上超越既有最强的best_quality。官方在 AutoMLBenchmark 上的观测结果是在 64 核 CPU 机器上运行 4 小时experimental_quality对best_quality的胜率约为 70%。在仓库中该预设被定义为一个带版本后缀的配置键experimental_quality_v120见 presets_configs.py# DOES NOT SUPPORT GPU. experimental_quality_v120{ auto_stack: True, dynamic_stacking: auto, num_bag_sets: 1, hyperparameters: experimental, fit_strategy: parallel, num_gpus: 0, time_limit: 3600, },从源码可以看出该预设的几个关键设计hyperparameters: experimental指向一个名为experimental的超参数组合其内容在 hyperparameter_configs.py 中定义本质是TABPFNMIX 2023 年零样本zeroshot超参数组合的叠加。fit_strategy: parallel开启并行模型拟合详见下文。num_gpus: 0源码注释明确标注DOES NOT SUPPORT GPU该预设仅面向 CPU 场景。time_limit: 3600默认 1 小时训练时限。官方给出的使用建议是至少 16 核 CPU、64 GB 内存、time_limit设置为 4 小时以上才能充分发挥该预设的优势。由于是实验性预设官方希望用户通过 GitHub Issue 反馈使用中遇到的问题。使用方式from autogluon.tabular import TabularDataset, TabularPredictor train_data TabularDataset(https://autogluon.s3.amazonaws.com/datasets/Inc/train.csv) label class predictor TabularPredictor(labellabel, problem_typebinary).fit( train_data, presetsexperimental_quality, time_limit4 * 3600 )由于该预设不允许 GPU务必在 CPU 机器上运行。重点特性二TabPFNMix——AutoGluon 首个表格基础模型模型背景TabPFNMix 是 AutoGluon 团队自研的首个表格数据基础模型仅使用合成数据预训练。它建立在 TabPFN 与 TabForestPFN 的既有工作之上据官方发布说明所述在训练样本 1000 至 10000 条的数据集上取得了当时开源单模型的新水平并且支持回归任务TabPFN 系列此前通常仅覆盖分类。官方在 TabRepo 的 109 个训练样本不超过 10000 的分类数据集上报告微调后的 TabPFNMix 相对最强树模型 CatBoost 胜率为 64%相对微调版 TabForestPFN 胜率为 61%。官方建议的使用前提训练样本小于 50,000 条、尽量大的时间预算、64 GB 以上内存。当前该工作仍处于早期阶段。源码中的模型接入TabPFNMix 在仓库中对应TABPFNMIX这一超参键其默认配置定义在 hyperparameter_configs.pytabpfnmix_default { model_path_classifier: autogluon/tabpfn-mix-1.0-classifier, model_path_regressor: autogluon/tabpfn-mix-1.0-regressor, n_ensembles: 1, max_epochs: 30, ag.sample_rows_val: 5000, # Beyond 5k val rows fine-tuning becomes very slow ag.max_rows: 50000, # Beyond 50k rows, the time taken is longer than most users would like (hours) ag_args: {name_suffix: _v1}, }这些默认值背后是对计算成本的明确权衡ag.max_rows: 50000超过 5 万行训练数据后训练耗时将达数小时且模型在此规模下优势微弱故被设为上限ag.sample_rows_val: 5000验证集超过 5000 行时微调会显著变慢因此对验证集抽样n_ensembles: 1与max_epochs: 30控制集成数量与微调轮数是精度与开销的平衡点。模型实现位于 tabpfnmix_model.py并注册进模型注册表见 models/init.py 与 registry/_ag_model_registry.py。使用者也可绕过预设、直接在hyperparameters中指定predictor TabularPredictor(labellabel).fit( train_data, hyperparameters{TABPFNMIX: {}}, time_limit3600, )重点特性三fit_strategyparallel并行拟合策略参数语义TabularPredictor 在 1.2 中新增fit_strategy拟合参数取值类型定义于 predictor.pyfit_strategy: Literal[sequential, parallel] sequential,sequential默认沿用以往的串行拟合方式parallel在 16 核及以上的机器上并行训练多个模型官方估算在 64 核下大多数数据集可获得2-4 倍加速且核数越多加速越明显。fit_strategyparallel已默认内置在experimental_quality预设中见上文预设配置也可单独启用predictor TabularPredictor(labellabel).fit( train_data, fit_strategyparallel, num_cpus64, time_limit3600 )源码中在 predictor.py 提供了_validate_fit_strategy校验逻辑非法取值会直接抛出ValueError。在 abstract_trainer.py 中实现了并行的资源调度与拟合流程相关确定性行为由测试 test_bagged_deterministic.py 覆盖。需要留意并行拟合会同时占用多核资源官方建议在 16 核以上机器使用低核数机器上并行收益有限。重点特性四堆叠层剪枝与决策阈值校准堆叠层模型剪枝3 倍推理加速官方发布说明中标记为 Major 的一项改进是修复 stacker 的max_models逻辑对应 PR #4290在小数据集上实现3 倍推理加速且零精度损失。其原理是堆叠层stacking layer中存在大量模型组合冗余1.2 通过更精确地限制堆叠层使用的模型数量max_models在保持集成精度的同时减少推理时需加载与执行的模型数目。这对推理延迟敏感的小规模应用非常实用无需任何配置改动即可获得。决策阈值校准calibrate_decision_thresholdauto成为默认1.2 将calibrate_decision_threshold的默认值改为auto并大幅改进了决策阈值校准算法。对于二分类且评估指标为f1或balanced_accuracy的场景这一改动能显著提升最终成绩。其机制是通过校准概率分布并自动搜索最优决策阈值而不是默认采用 0.5 阈值。同批改进还包括温度缩放temperature scaling优化改用最佳迭代而非最后一轮迭代的温度值PR #4396并在发现负温度时自动跳过缩放PR #4397从而提升校准稳定性。重点特性五Chronos-Bolt——更快更强的时序基础模型架构与性能Chronos-Bolt 是 AutoGluon 集成的最新时序基础预测模型基于T5 encoder-decoder 架构在近 1000 亿条时间序列观测上训练。与原始 Chronos 的关键区别在于分块patch机制将历史上下文切分为包含多个观测点的 patch 输入编码器解码器基于这些表示直接生成多步分位数预测即直接多步预测direct multi-step forecasting。官方发布说明给出的性能数据相比同规模的原始 Chronos推理速度最高提升250 倍内存效率提升20 倍在 27 个数据集的基准上以 WQL 与 MASE 度量零样本 Chronos-Bolt 在无先验接触的情况下超越了在这些数据集上训练过的常见统计模型与深度学习模型Chronos-BoltBase在精度上超越原始 ChronosLarge同时快 600 倍以上。四种模型规格与 CPU 支持Chronos-Bolt 提供四个尺寸映射关系定义在 model.py别名模型标识参数量官方数据bolt_tinyautogluon/chronos-bolt-tiny9Mbolt_miniautogluon/chronos-bolt-mini21Mbolt_smallautogluon/chronos-bolt-small48Mbolt_baseautogluon/chronos-bolt-base205M默认模型路径为autogluon/chronos-bolt-small见 model.py。所有规格均可在 CPU 上运行。使用示例from autogluon.timeseries import TimeSeriesDataFrame, TimeSeriesPredictor train_data TimeSeriesDataFrame(...) predictor TimeSeriesPredictor(prediction_length24).fit( train_data, hyperparameters{ChronosBolt: {model_path: bolt_base}}, )Chronos / Chronos-Bolt 微调1.2 为 Chronos 与 Chronos-Bolt 都新增了**无缝微调fine-tuning**能力可针对目标任务数据进一步适配基础模型相关改动集中在 PR #4608、#4645、#4653 等系列提交中。官方在 forecasting-chronos.ipynb 教程中演示了微调用法。重点特性六协变量回归器Covariate Regressors1.2 为所有时序预测模型新增了covariate_regressor支持PR #4566、#4641。背景问题Chronos-Bolt 等基础模型只依赖目标序列自身历史数据无法直接利用外生信息如节假日、促销活动。协变量回归器的解决思路是两阶段残差方案先用一个表格回归模型基于已知协变量与静态特征static features拟合每个时间步的目标值将协变量回归器的预测从目标列中减去得到残差单变量时序模型如 Chronos-Bolt只对残差做预测。最终预测 协变量回归器预测 单变量模型对残差的预测。这样既保留了基础模型的强大时序建模能力又接入了外生信息。官方在 Chronos 教程中演示了协变量回归器与 Chronos-Bolt 的组合用法。其余值得关注的改进Tabular 模块Predictor 回调callbacks支持PR #4327、#4473可在拟合流程中挂载自定义回调如早停、日志监控等。学习曲线生成PR #4411、#4635内置生成学习曲线的能力。新评估指标roc_auc_ovo与roc_auc_ovrPR #4248同时修复多分类roc_auc由weighted改为macro聚合PR #4407。自定义软内存限制PR #4333与refit_full尊重用户指定的num_cpus/num_gpusPR #4495。NN_TORCH 增强新增 AdamW 优化器支持PR #4610、AdaptiveES 早停默认启用、max_epochs由 500 提升至 1000PR #4436。delay_bag_sets默认改为FalsePR #4552控制重复交叉验证行为num_bag_sets默认设为 1PR #4446避免用户未使用预设时意外启用多组 bag。raise_on_no_models_fittedTrue成为默认PR #4400无模型拟合成功时直接报错而非静默。positive_class成为 TabularPredictor 的初始化参数PR #4445。TabularDataset 重构PR #4613初始化后始终返回 pandas DataFrame 对象简化文档并提升 IDE 调试可视化兼容性。compute_metric取代compute_weighted_metricPR #4631EnsembleSelection 拟合提速 2 倍以上PR #4367DropDuplicatesFeatureGenerator 拟合提速 2 倍以上PR #4543启用 aarch64 平台构建PR #4663。TimeSeries 模块TimeSeriesPredictor.leaderboard支持计算额外指标并返回各模型超参数PR #4481。target_scaler支持所有预测模型PR #4460、#4644。TimeSeriesDataFrame 可转换为普通 pandas DataFramePR #4415。实验性能力加权累计误差指标PR #4594、自定义时序集成模型类型PR #4662。统一全部 Croston 模型为单一类PR #4564、更新 GluonTS 至 v0.16.0、statsforecast升级至 1.7、优化频率推断逻辑PR #4540与TimeSeriesFeatureGenerator预处理的耗时和内存占用PR #4557。Multimodal 模块目标检测相关增强coco_root自定义 COCO 数据集支持PR #3809、COCO 格式保存支持与 I/O 处理更新PR #3811、每个 HPO trial 可配置保留的 checkpoint 数量PR #4615。修复多分类 proba 指标PR #4643、LogLoss 计算 bugPR #4629、恢复训练时验证指标缺失问题PR #4449。兼容 torch 2.4并完成 timm、accelerate、nltk 等依赖的版本更新。依赖与安装变化1.2 的依赖范围更新以官方发布说明为准numpy1.25.0,2.1.4scipy1.5.4,1.16torch2.2,2.6torchvision0.16.0,0.21.0ray2.10.0,2.40scikit-learn1.4.0,1.5.3lightgbm4.0,4.6xgboost1.6,2.2transformers4.38.0,5accelerate0.34.0,1.0lightning2.2,2.6pyarrow15.0.0安装层面full_install.sh改为并行安装并引入uv源码安装速度显著提升PR #4582、#4587、#4592。CPU 安装指南新增cpu标记相关说明见仓库的 docs/install-cpu-pip.md、docs/install-gpu-pip.md 等安装文档。总结与升级建议AutoGluon 1.2.0 的定位是激进引入新能力的版本experimental_quality预设把 TabPFNMix 与并行拟合打包成开箱即用的实验入口为后续并入正式预设收集社区反馈Chronos-Bolt 则直接提升了时序基础模型在精度与速度上的可用性。对于实际使用者建议升级前确认 Python 版本需要 Python 3.9 及以上3.8 已不再支持且需接受旧模型不可加载的限制重新训练模型尝试实验性能力时遵循官方硬件建议experimental_quality需要 16 核以上 CPU、64 GB 内存、4 小时以上的时间预算且不支持 GPU表格小样本场景优先尝试 TabPFNMix训练样本小于 5 万条时收益最大时序场景优先选用 Chronos-Bolt同尺寸下速度与精度均优于原始 Chronos且有协变量回归器补足外生信息能力。相关发布说明全文可查阅本仓库的 docs/whats_new/v1.2.0.md各模块后续版本变更可继续查看 docs/whats_new/ 目录下的版本文件。【免费下载链接】autogluonFast and Accurate ML in 3 Lines of Code项目地址: https://gitcode.com/GitHub_Trending/au/autogluon创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/9/15 23:59:09

Android 15车载音频调试全指南:从路由到投屏故障排查实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/15 23:59:09

深入EventBus内核:注册、线程模型与粘性事件全解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/16 0:44:13

地图瓦片切割工具详解:从瓦片金字塔到前端高效加载

1. 工具定位与核心问题1.1 为什么你需要一个瓦片切割工具白日门地图瓦片切割工具,说白了就是解决一个很具体的问题:你手里有一张完整的大地图,可能是游戏的区域规划图、GIS系统的遥感影像、甚至是一张超大的手绘地图,但直接用浏览…

2026/9/16 0:44:13

行业Agent与RAG技术:架构设计与实践优化

1. 行业Agent与RAG技术概述在AI技术快速发展的当下,行业Agent(智能代理)正逐渐成为企业数字化转型的核心工具。这类Agent能够模拟人类专家在特定领域的决策过程,而RAG(Retrieval-Augmented Generation,检索…

2026/9/16 0:44:13

AI生成内容检测原理与降低AI率的实用方法

1. 论文AI率检测的现状与挑战最近在学术圈和内容创作领域,关于AI生成内容检测的话题引发了广泛讨论。DeepSeek等大型语言模型生成的文本,在某些检测工具中显示高达99%的AI率,这让许多研究者感到困扰。作为一名长期使用各类AI工具辅助写作的从…

2026/9/15 4:54:30

拯救者Y7000黑屏故障排查与维修实战指南

1. 项目概述:一台黑屏的拯救者Y7000,到底卡在哪一步? 联想拯救者Y7000系列笔记本,从2018年第一代搭载i5-8300H开始,到后来的i7-9750H、i7-10750H、i5-11400H,再到2023年款的R7-7840HS,它始终是学…

2026/9/16 0:04:09

PHP源码部署实战:从环境配置到运行情侣游戏全攻略

简介:这是一套面向情侣互动场景的PHP完整源码,集成情侣飞行棋、真心话大冒险、情趣骰子等玩法,并内置完整分销制度,可自定义多种返佣比例,源码完全开源无加密,支持微信无感自动授权登录与第三方授权&#x…

2026/9/15 14:22:53

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/15 21:31:11

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/15 11:42:23

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码