概述

xLSTM缩放定律研究深入分析了xLSTM架构相比Transformer的缩放行为,揭示了xLSTM在计算最优模型推理效率长上下文处理方面的独特优势。1

核心发现:

  1. 计算最优模型:xLSTM的最优规模比Transformer更大
  2. 幂律缩放:在5个数量级的计算范围内保持良好缩放
  3. 推理优势:长序列下TTFT和单步时间显著更优
  4. FLOPs效率:相比Transformer有更好的loss-to-FLOP比

1. 缩放实验设置

1.1 模型规模范围

实验覆盖了广泛的模型规模:

参数规模隐藏维度层数训练Tokens
80M1024122B
200M1536245B
500M20483610B
1B25604820B
3B30726050B
7B409648200B

1.2 训练数据集

训练语料:

  • Pile:300B tokens
  • SlimPajama:额外100B tokens
  • 总计:最多200B tokens/模型

1.3 评估指标

主要评估指标:

  • 困惑度(PPL):语言建模质量
  • FLOPs:计算成本
  • TTFT:Time To First Token(首Token时间)
  • Step Time:每步推理时间

2. 训练损失缩放

2.1 统一缩放定律

xLSTM和Transformer都遵循统一缩放定律

其中:

  • :模型参数量
  • :训练数据量
  • :测试损失
  • :拟合参数

2.2 拟合结果

参数TransformerxLSTM差异
0.0760.072接近
0.1030.098接近
2.142.12接近

结论:xLSTM和Transformer具有相似的幂律指数,但xLSTM的常数项略低。

2.3 Loss-COMPUTE曲线

Log(计算量) vs Log(损失)
         │
    2.5 ┤              ● Transformer
         │           ╱
    2.6 ┤         ╱  ● xLSTM
         │       ╱  /
    2.7 ┤     ╱   ╱
         │   ╱  ╱
    2.8 ┤ ╱ ╱
         │╱╱
    2.9 ┤
         └─────────────────────
           17    19    21    23
              Log(C)

观察:xLSTM在相同计算量下达到更低的损失


3. 计算最优模型分析

3.1 理论分析

计算最优模型满足:

即增加模型参数和增加训练数据的边际收益相等。

3.2 最优N-D关系

对于Transformer:

对于xLSTM:

3.3 实验结果

计算预算(C)Transformer最优NxLSTM最优N比率
85M120M1.41x
300M480M1.60x
1.1B2.0B1.82x
4.2B8.5B2.02x
15B35B2.33x

关键发现:xLSTM的最优模型规模是Transformer的1.4-2.3倍

3.4 解释

为什么xLSTM的最优模型更大?

  1. 更低的推理成本:xLSTM的线性复杂度使大模型更”便宜”
  2. 更好的参数效率:指数门控增强了表达能力
  3. 更快的收敛:需要更少的数据即可达到相同性能

4. 推理时间特性

4.1 推理时间分解

LLM推理分为两部分:

阶段描述Transformer时间xLSTM时间
Prefill处理输入prompt
Decode自回归生成

4.2 Time to First Token (TTFT)

TTFT包括:

  1. Prefill时间:处理输入
  2. 调度时间:GPU分配
  3. 内存加载:权重加载
序列长度Transformer TTFTxLSTM TTFT加速
1K50ms35ms1.43x
4K200ms45ms4.4x
8K800ms55ms14.5x
16K3200ms70ms45.7x

4.3 单步推理时间

序列长度TransformerxLSTM加速
1K10ms9ms1.1x
4K10ms9ms1.1x
8K10ms9ms1.1x
16K10ms9ms1.1x

观察:Decode阶段两者相近,但xLSTM的常数更小

4.4 内存与带宽

指标TransformerxLSTM
参数内存
KV Cache
16K序列KV Cache~16GB~0.5GB
内存带宽利用率较高更高

5. 上下文长度缩放

5.1 实验设置

测试不同上下文长度下的性能:

上下文长度评估方式
2K标准
4K标准
8KRoPE插值
16KRoPE插值
32KYaRN + RoPE

5.2 困惑度随上下文变化

模型2K4K8K16K32K
Transformer12.511.811.210.810.5
xLSTM12.311.510.810.29.8

观察:xLSTM随上下文增长的性能衰减更小

5.3 解释

xLSTM的长上下文优势来源:

  1. 线性注意力:避免二次复杂度
  2. 矩阵记忆:增强长程依赖建模
  3. 门控机制:选择性遗忘无关信息

6. 训练效率分析

6.1 FLOPs效率

Loss-to-FLOPs比率定义:

模型规模Transformer xLSTM 改善
100M1.001.08+8%
500M1.001.12+12%
1B1.001.15+15%
7B1.001.22+22%

6.2 内存效率

指标TransformerxLSTM差异
激活内存显著节省
梯度内存相近
优化器状态相近

6.3 分布式训练

xLSTM在分布式训练中的特点:

# xLSTM的并行化策略
parallel_config = {
    "tensor_parallel": {
        "embedding": "row_parallel",
        "output": "col_parallel",
    },
    "pipeline_parallel": {
        "attention": "standard",
        "ssm": "interleaved",  # SSM更适合流水线
    },
    "sequence_parallel": {
        "enabled": True,
        "attention_mask": "local",
    }
}

7. 与其他架构的对比

7.1 缩放指数对比

架构最优N∝
Transformer0.0760.103
Mamba0.0740.100
RWKV-40.0750.102
GLA0.0730.099
xLSTM0.0720.098

7.2 推理特性对比

特性TransformerMambaxLSTM
Prefill复杂度
Decode复杂度
KV Cache
最优模型比例1.0x1.1x1.4-2.3x

8. 实践建议

8.1 模型选择指南

场景推荐架构
短序列(<2K)Transformer
长序列(>4K)xLSTM/Mamba
状态追踪任务xLSTM
代码生成Transformer
对话系统xLSTM

8.2 计算预算分配

基于xLSTM缩放定律的建议:

def compute_budget_allocation(total_compute, architecture='xlstm'):
    """
    计算最优模型规模
    
    Args:
        total_compute: 总计算量 (FLOPs)
        architecture: 'xlstm' 或 'transformer'
    """
    if architecture == 'xlstm':
        gamma = 0.54  # xLSTM的指数
    else:
        gamma = 0.50  # Transformer的指数
    
    # 最优参数量
    N_opt = total_compute ** gamma
    
    # 最优训练数据量
    D_opt = total_compute / (N_opt * C_forward)
    
    return N_opt, D_opt

8.3 超参数建议

参数Transformer建议xLSTM建议
学习率
Batch Size4M tokens4M tokens
Warmup2%2%
权重衰减0.10.1
梯度裁剪1.01.0

9. 总结

xLSTM的缩放定律研究揭示了以下关键洞察:

  1. 相似但更优的幂律:xLSTM遵循与Transformer相似的缩放规律,但常数项更低

  2. 更大的计算最优模型:xLSTM的最优模型规模是Transformer的1.4-2.3倍

  3. 显著的长上下文优势:16K序列下TTFT加速45x

  4. 更好的FLOPs效率:7B规模下**22%**的训练效率提升

这些发现为未来LLM架构选择和训练策略提供了重要参考。


参考资料


相关文档:[[xlstm-7b-advanced-architecture]、[scaling-laws-redundancy-theory]、[transformer-scaling-laws]]


第10章:xLSTM Scaling Laws 完结版 (ICLR 2026)

论文背景

Maximilian Beck, Kajetan Schweighofer, Sebastian Böck, Sebastian Lehner 和 Sepp Hochreiter 在 ICLR 2026 上发表完整版 xLSTM 缩放定律研究论文:

“xLSTM Scaling Laws: Competitive Performance with Linear Time-Complexity”

OpenReview: https://openreview.net/forum?id=bpbU549sSg

这是 xLSTM 系列研究的核心定量结论,给出了在 80M 到 7B 参数范围内完整拟合的 scaling law,并首次系统比较了 xLSTM 与 Transformer 在训练计算量维度上的差异。2

完整 scaling law 推导

论文给出的最终公式:

其中:

  • :模型参数量
  • :训练token数
  • :拟合常数
  • :测试集损失(nats/token)

与 Transformer 形式对比

Transformer (Chinchilla)xLSTM (2026)
0.0760.072
0.1030.098
1.0 (线性内)1.02 (轻微凸)
2.142.09

xLSTM 的 略小(说明更平缓),但 更低(说明渐近损失更优)。3

与 Transformer scaling law 对比

Compute-Loss 曲线

log(L)
  ↑
2.5 |  ●━━━━━ Transformer
    |       ╲
2.6 |        ╲ ●━━━━ xLSTM
    |         ╲
2.7 |          ╲
    |           ╲
2.8 |            ╲
    |             ╲
2.9 |              ╲
    └──────────────────→ log(C)
      17  18  19  20  21

关键观察:在相同的训练计算量下,xLSTM 始终达到更低的损失。差距随模型规模扩大而增大,7B 规模约 0.05 nats 的优势。

线性复杂度的训练 FLOPs 优势

xLSTM 的核心架构优势在于 sLSTM 和 mLSTM 的线性时间复杂度4

单token训练 FLOPs

组件TransformerxLSTM
Attention
SSM/记忆
FFN
总计

注: 为训练序列长度。

时,Transformer 的 attention FLOPs 超过 FFN,成为瓶颈;xLSTM 始终保持稳定。

Compute-Optimal 分配

论文给出 compute-optimal 的精确公式(设总计算 ):

Transformer (Chinchilla):

xLSTM(本文拟合):

计算预算 (FLOPs)比率
205M295M1.44×
650M1.0B1.54×
2.05B3.5B1.71×
6.5B12.3B1.89×

xLSTM 的 compute-optimal 模型显著更大,但因为训练 FLOPs 总量固定,更大模型意味训练数据更少。5

1B-7B 规模验证

论文在 1B、3B、7B 三个规模上验证了 scaling law 的预测精度:

模型规模实际训练损失Scaling law 预测误差
1B xLSTM2.4562.461+0.20%
3B xLSTM2.2982.303+0.22%
7B xLSTM2.1872.194+0.32%

结论:scaling law 在 80M 到 7B 的4个数量级范围内精确预测训练损失(误差 < 0.5%)。

实际意义

对于同样的训练 FLOPs 预算:

  • 若按 Transformer 配比训练 xLSTM:xLSTM 损失更低(最优模型略欠训练)
  • 若按 xLSTM 配比训练 Transformer:Transformer 损失显著高于最优
  • 最优策略:使用 xLSTM 的 compute-optimal 配比训练 xLSTM

PyTorch 训练示例

import torch
import torch.nn as nn
from xlstm import xLSTMBlock, xLSTMLMConfig
 
def compute_optimal_xlstm(total_compute_flops, tokenizer_vocab_size):
    """
    根据xLSTM scaling law计算最优模型规模和训练token数
    total_compute_flops: 总训练FLOPs预算
    """
    # xLSTM拟合参数(ICLR 2026完结版)
    gamma_N = 0.54
    gamma_D = 0.46
    
    # 最优参数量
    N_opt = 0.58 * (total_compute_flops ** gamma_N)
    
    # 最优token数
    D_opt = total_compute_flops / (6 * N_opt)
    
    # 模型配置
    config = xLSTMLMConfig(
        vocab_size=tokenizer_vocab_size,
        embedding_dim=int(64 * (N_opt / 1e9) ** 0.5),
        num_layers=int(16 * (N_opt / 1e9) ** 0.3),
        mlstm_hidden=int(N_opt ** 0.5),
        slstm_hidden=int(N_opt ** 0.4),
    )
    
    return N_opt, D_opt, config
 
# 示例:训练预算1e21 FLOPs (~50B参数训练量)
N_opt, D_opt, config = compute_optimal_xlstm(
    total_compute_flops=1e21,
    tokenizer_vocab_size=50257
)
print(f"最优模型规模: {N_opt/1e9:.2f}B")
print(f"最优训练token: {D_opt/1e9:.0f}B")
 
# 训练循环(简化)
model = xLSTMBlock(config)
optimizer = torch.optim.AdamW(model.parameters(), lr=1.2e-4, weight_decay=0.1)
scheduler = torch.optim.lr_scheduler.CosineAnnealingLR(
    optimizer, T_max=int(D_opt / config.batch_size)
)
 
for step in range(int(D_opt / config.batch_size)):
    batch = next(train_loader)  # (B, T)
    logits = model(batch)
    loss = nn.functional.cross_entropy(
        logits.view(-1, config.vocab_size),
        batch.view(-1)
    )
    
    optimizer.zero_grad()
    loss.backward()
    torch.nn.utils.clip_grad_norm_(model.parameters(), 1.0)
    optimizer.step()
    scheduler.step()

第11章:xLSTM 7B 工业级实现 (ICML 2025)

论文背景

Beck 等人在 ICML 2025 发表 “xLSTM 7B: A Recurrent LLM for Fast and Efficient Inference”,给出了 xLSTM 7B 模型的完整实现细节。6

链接

7B 模型架构

xLSTM-7B 混合使用 sLSTM 和 mLSTM 块:

参数
总参数6.85B
嵌入维度4096
层数48
sLSTM:mLSTM 比例1:3
注意力头数(mLSTM)8
FFN 隐藏维度16384
词汇表大小50257
上下文长度8192
训练 token 数250B

与 Transformer 7B 推理速度对比

Prefill 阶段(处理 长度的 prompt):

Llama-2 7BxLSTM-7B加速
51238ms28ms1.36×
102475ms31ms2.42×
2048188ms36ms5.22×
4096612ms48ms12.75×
81922300ms72ms31.9×

Decode 阶段(单 token 生成):

上下文长度Llama-2 7BxLSTM-7B加速
5129.2ms8.1ms1.14×
40969.4ms8.2ms1.15×
81929.6ms8.3ms1.16×

总生成时间(512 prompt + 256 生成):

  • Llama-2 7B:38 + 256×9.2 ≈ 2393ms
  • xLSTM-7B:28 + 256×8.1 ≈ 2102ms
  • 加速比:1.14×(短 prompt),14×(长 prompt)

内存占用对比

资源Llama-2 7BxLSTM-7B节省
参数内存 (fp16)13.5 GB13.5 GB0%
KV Cache (8K ctx, batch=1)16.0 GB0.4 GB97.5%
激活内存 (batch=8)24.5 GB12.2 GB50.2%
总峰值 (8K ctx, batch=8)54.0 GB26.1 GB51.7%

核心优势:xLSTM 几乎不需要 KV Cache(仅 mLSTM 块需要极少缓存),这使长上下文推理的内存占用大幅降低。7

训练细节

xLSTM-7B 的训练配置:

training_config = {
    # 优化器
    "optimizer": "AdamW",
    "learning_rate": 1.2e-4,
    "min_lr_ratio": 0.1,
    "weight_decay": 0.1,
    "beta1": 0.9,
    "beta2": 0.95,
    
    # 调度
    "scheduler": "cosine",
    "warmup_steps": 2000,
    
    # 批处理
    "batch_size_tokens": 4_000_000,
    "sequence_length": 8192,
    
    # 训练量
    "total_tokens": 250_000_000_000,
    
    # 硬件
    "hardware": "256 × H100",
    "training_time": "21 days",
    "precision": "bf16 + fp32 master weights",
    
    # 稳定性技巧
    "gradient_clip": 1.0,
    "z_loss_weight": 1e-4,
    "slstm_stabilization": "exponential gating",
}

评估结果

xLSTM-7B 在标准基准上的表现:

任务Llama-2 7BxLSTM-7B差异
WikiText PPL5.475.41+0.06
LAMBADA73.9%74.2%+0.3%
HellaSwag76.1%75.8%-0.3%
ARC-c48.5%47.9%-0.6%
MMLU45.3%44.7%-0.6%
HumanEval14.6%15.2%+0.6%
GSM8K14.8%16.3%+1.5%

总体结论:xLSTM-7B 在代码生成(HumanEval)和数学推理(GSM8K)上有明显优势,传统 NLP 基准持平。8

部署建议

场景1:长上下文检索增强生成(RAG)

# 推荐:xLSTM-7B在32K+上下文下优势显著
from xlstm import xLSTM7B
 
model = xLSTM7B.from_pretrained("xlstm-7b-base")
model.to("cuda:0")
 
# 长上下文推理无需KV Cache管理
context = open("long_document.txt").read()  # 32K tokens
prompt = f"根据以下文档回答问题:\n{context}\n\n问题:..."
 
with torch.no_grad():
    response = model.generate(
        prompt,
        max_new_tokens=512,
        # 无需past_key_values参数
    )

场景2:高吞吐批处理

xLSTM 的 sLSTM 块完全 sequential,但 mLSTM 块支持并行。在 batch size ≥ 16 时,xLSTM-7B 的吞吐量优于 Llama-2 7B 约 40%(相同硬件)。

场景3:边缘部署

xLSTM 的内存优势使其在 24GB 显存的消费级 GPU(如 RTX 4090)上可运行 7B 模型的 8K 上下文推理,而 Llama-2 7B 需要开启 offloading。

与其他 7B 模型的推理对比

模型Prefill (4K)Decode (单步)总吞吐 (tokens/s)KV Cache (8K)
Llama-2 7B612ms9.4ms10516.0 GB
Mistral 7B580ms9.1ms1108.0 GB
Mamba-7B48ms8.5ms1170.4 GB
xLSTM-7B48ms8.2ms1210.4 GB
RWKV-6 7B52ms8.7ms1140.3 GB

xLSTM-7B 在各项指标上均处于领先地位。9


参考(扩展部分)


更多相关词条注意力与SSM统一理论SSM瓶颈理论SSM表达力状态大小理论缩放定律冗余理论*

Footnotes

  1. Beck, M. et al. (2026). xLSTM Scaling Laws: Competitive Performance with Linear Time-Complexity. ICLR 2026.

  2. Beck, M. et al. (2026). xLSTM Scaling Laws: Competitive Performance with Linear Time-Complexity. ICLR 2026. OpenReview: https://openreview.net/forum?id=bpbU549sSg.

  3. Beck, M. et al. (2026). xLSTM Scaling Laws. Section 5 (Parameter Fitting Results).

  4. Beck, M. et al. (2024). xLSTM: Extended Long Short-Term Memory. NeurIPS 2024. arXiv:2405.04517.

  5. Beck, M. et al. (2026). xLSTM Scaling Laws. Section 6 (Compute-Optimal Allocation).

  6. Beck, M. et al. (2025). xLSTM 7B: A Recurrent LLM for Fast and Efficient Inference. ICML 2025. PMLR v267. arXiv:2503.13427.

  7. Beck, M. et al. (2025). xLSTM 7B. Section 4.2 (Memory Footprint Analysis).

  8. Beck, M. et al. (2025). xLSTM 7B. Table 5 (Benchmark Results).

  9. Beck, M. et al. (2025). xLSTM 7B. Section 5 (Inference Speed Comparison).