发布时间:2026/8/27 18:24:04
轻量级模型,重量级性能,TinyLlama、LiteLlama小模型火起来了 前言当大家都在研究大模型LLM参数规模达到百亿甚至千亿级别的同时小巧且兼具高性能的小模型开始受到研究者的关注。小模型在边缘设备上有着广泛的应用如智能手机、物联网设备和嵌入式系统这些边缘设备通常具有有限的计算能力和存储空间它们无法有效地运行大型语言模型。因此深入探究小型模型显得尤为重要。接下来我们要介绍的这两项研究可能满足你对小模型的需求。TinyLlama-1.1B来自新加坡科技设计大学SUTD的研究者近日推出了 TinyLlama该语言模型的参数量为 11 亿在大约 3 万亿个 token 上预训练而成。TinyLlama 以 Llama 2 架构和分词器tokenizer为基础这意味着 TinyLlama 可以在许多基于 Llama 的开源项目中即插即用。此外TinyLlama 只有 11 亿的参数体积小巧适用于需要限制计算和内存占用的多种应用。该研究表示仅需 16 块 A100-40G 的 GPU便可在 90 天内完成 TinyLlama 的训练。该项目从上线开始持续受到关注目前星标量达到 4.7K。TinyLlama 模型架构详细信息如下所示训练细节如下研究者表示这项研究旨在挖掘使用较大数据集训练较小模型的潜力。他们重点探究在用远大于扩展定律scaling law建议的 token 数量进行训练时较小模型的行为表现。具体来说该研究使用大约 3 万亿个 token 训练具有 1.1B 个参数的 Transformer 仅解码器模型。据了解这是第一次尝试使用如此大量的数据来训练具有 1B 参数的模型。尽管规模相对较小但 TinyLlama 在一系列下游任务中表现相当出色它的性能显著优于同等大小的现有开源语言模型。具体来说TinyLlama 在各种下游任务中都超越了 OPT-1.3B 和 Pythia1.4B 。此外TinyLlama 还用到了各种优化方法如 flash attention 2、FSDP Fully Sharded Data Parallel 、 xFormers 等。在这些技术的加持下TinyLlama 训练吞吐量达到了每 A100-40G GPU 每秒 24000 个 token。例如TinyLlama-1.1B 模型对于 300B token 仅需要 3,456 A100 GPU 小时而 Pythia 为 4,830 小时MPT 为 7,920 小时。这显示了该研究优化的有效性以及在大规模模型训练中节省大量时间和资源的潜力。TinyLlama 实现了 24k tokens / 秒 / A100 的训练速度这个速度好比用户可以在 8 个 A100 上用 32 小时训练一个具有 11 亿参数、220 亿 token 的 chinchilla-optimial 的模型。同时这些优化也大大减少了显存占用用户可以把 11 亿参数的模型塞入 40GB 的 GPU 里面还能同时维持 16k tokens 的 per-gpu batch size。只需要把 batch size 改小一点 你就可以在 RTX 3090/4090 上面训练 TinyLlama。实验中该研究主要关注具有纯解码器架构的语言模型包含大约 10 亿个参数。具体来说该研究将 TinyLlama 与 OPT-1.3B、Pythia-1.0B 和 Pythia-1.4B 进行了比较。TinyLlama 在常识推理任务上的性能如下所示可以看出 TinyLlama 在许多任务上都优于基线并获得了最高的平均分数。此外研究者在预训练期间跟踪了 TinyLlama 在常识推理基准上的准确率如图 2 所示TinyLlama 的性能随着计算资源的增加而提高在大多数基准中超过了 Pythia-1.4B 的准确率。表3表明与现有模型相比TinyLlama 表现出了更好的问题解决能力。手快的网友已经开始整活了运行效果出奇得好在 GTX3060 上运行能以 136 tok / 秒的速度运行。「确实是快」小模型 LiteLlama由于 TinyLlama 的发布SLM小型语言模型开始引起广泛关注。德克萨斯工农大学的 Xiaotian Han 发布了 SLM-LiteLlama。它有 460M 参数由 1T token 进行训练。这是对 Meta AI 的 LLaMa 2 的开源复刻版本但模型规模显著缩小。项目地址https://huggingface.co/ahxt/LiteLlama-460M-1TLiteLlama-460M-1T 在 RedPajama 数据集上进行训练并使用 GPT2Tokenizer 对文本进行 token 化。作者在 MMLU 任务上对该模型进行评估结果如下图所示在参数量大幅减少的情况下LiteLlama-460M-1T 仍能取得与其他模型相媲美或更好的成绩。以下为该模型的性能表现更详细内容请参阅https://huggingface.co/datasets/open-llm-leaderboard/details_ahxt__llama2_xs_460M_experimental面对规模大幅缩小的 LiteLlama有网友好奇它是否能够在 4GB 的内存上运行。如果你也想知道不如亲自试试看吧。最后的最后感谢你们的阅读和喜欢我收藏了很多技术干货可以共享给喜欢我文章的朋友们如果你肯花时间沉下心去学习它们一定能帮到你。因为这个行业不同于其他行业知识体系实在是过于庞大知识更新也非常快。作为一个普通人无法全部学完所以我们在提升技术的时候首先需要明确一个目标然后制定好完整的计划同时找到好的学习方法这样才能更快的提升自己。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】大模型知识脑图为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。经典书籍阅读阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。实战案例光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

2026/8/27 18:24:04

游戏分发渠道全解析:一款游戏是通过什么路径到达玩家的

再好的游戏,如果玩家找不到、下载不了,也无法产生任何价值。分发渠道,就是连接游戏和玩家之间的"桥梁"。它决定了一款游戏能触达多少用户、以什么成本触达、以及最终能分到多少收入。 对发行商而言,选择什么渠道、如何组合渠道、如何与渠道博弈分成,是决定商业…

2026/8/27 18:19:04

NVIDIA整合Groq:AI推理进入机架级系统工程时代

如果你最近在参与 LLM 推理服务部署、模型上线、或者只是在评估“该买什么 GPU 跑 AI 应用”,大概率会遇到一个很矛盾的现象:单看芯片算力,NVIDIA 的旗舰卡已经强到让上一代硬件显得过时,但真正把大模型跑起来、服务上线之后&…

2026/8/27 18:19:04

AI编码代理的“氛围税”:隐性成本、量化脚本与工程治理

这是一个值得认真思考的好选题。很多人都在夸 AI 编码代理“生成代码快”“补全准”,但很少有文章认真算一笔账:团队用了三个月之后,代码库为什么反而更乱了?为什么新人上手反而更慢了?为什么线上故障变多了&#xff1…

2026/8/27 18:59:07

Android高手笔记-屏幕适配 UI优化

屏幕与适配由于Android碎片化严重,屏幕分辨率千奇百怪,而想要在各种分辨率的设备上显示基本一致的效果,适配成本越来越高;屏幕适配究其根本只有两个问题:在不同尺寸及分辨率上UI的一致(影响着用户体验&…

2026/8/27 18:59:07

2027届论文降重平台横评:五款工具实测对比

论文降重这件事,2027届的毕业生现在应该陆续开始了。导师催稿的消息一条接一条,查重报告上飘红的段落刺得人眼睛疼,偏偏那些重复的句子改来改去还是那个意思。市面上的降重工具少说也有几十款,真到了要用的时候反而不知道怎么选。…

2026/8/27 18:54:07

AI去痕工具哪个好?2026最新去AI痕迹软件评测

现在很多工作都会用AI来提效,我们这些新媒体运营、小博主、文字工作者也经常拿它生成初稿,效率确实上来了,但ai去痕就成了绕不开的难题。 很多AI产出的文字逻辑通顺,可是模板腔很重,一眼就能看出机器写的,…

2026/8/26 9:13:28

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/27 10:58:22

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/27 7:46:21

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/27 0:01:16

Go语言构建企业级AI服务网关:统一管理英伟达等AI接口调用

1. 项目概述:从零构建一个企业级的AI服务网关 最近在帮一个做内容审核的团队做技术架构升级,他们原来的业务里,每天有几十万张图片和短视频需要过审,最初是接了几个开源的AI模型自己部署,但效果和性能一直不太稳定。后…

2026/8/27 0:01:16

LeetCode Hot100(51-60)算法精解与面试技巧

1. 题目背景与核心价值"hot100(51-60)"这个标题看起来像是某个编程题库或算法练习集中的一组题目编号。在技术社区中,类似命名通常指向LeetCode、牛客网等平台的热门题目集合。作为刷过300题的算法老手,我理解这类题目的核心价值在于&#xff…

2026/8/27 0:01:16

CRC校验实战:从模2除法到HJ212协议排错

1. 为什么一个“校验码”能扛住工业现场90%的数据 corruption? 你有没有遇到过这样的场景:嵌入式设备通过RS-485上传温湿度数据,上位机偶尔收到一帧乱码——温度显示成-273℃,湿度跳到999%,但串口波形看起来完全正常&a…

2026/8/26 19:34:06

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/26 19:17:08

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/26 19:34:05

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…