Skip to content

PR: 新增 Qwen3-8B RLOO FSDP2 Ascend NPU 训练脚本 - #105

Open
erfgss wants to merge 1 commit into
verl-project:mainfrom
erfgss:qwe3_8b_rloo
Open

PR: 新增 Qwen3-8B RLOO FSDP2 Ascend NPU 训练脚本#105
erfgss wants to merge 1 commit into
verl-project:mainfrom
erfgss:qwe3_8b_rloo

Conversation

@erfgss

@erfgss erfgss commented Sep 7, 2026

Copy link
Copy Markdown

PR: 新增 Qwen3-8B RLOO FSDP2 Ascend NPU 训练脚本

概述

新增 verl-ascend-recipe/rloo/run_qwen3_8b_rloo_fsdp_npu.sh,提供一套在昇腾Ascend A2/A3 上使用 RLOO 算法训练 Qwen3-8B 的开箱即用启动脚本。训练侧采用 FSDP2 并行策略,推理侧采用 vLLM-Ascend 作为 rollout 引擎。

主要特性

  • 算法:RLOO(algorithm.adv_estimator=rloo),在 reward 中使用 KL 惩罚(kl_coef=0.001),不启用 critic(critic.enable=False)。
  • 训练后端:FSDP2,bfloat16,开启参数/优化器 offload 与 gradient checkpointing,适配单卡 NPU 显存受限场景。
  • Rollout 引擎:vLLM-Ascend(V1),gpu_memory_utilization=0.82,每 prompt 采样 n=5,开启 chunked prefill、prefix caching、free_cache_engine,并配置 CUDA graph 捕获尺寸(FULL_DECODE_ONLY 模式)。
  • Reward:使用 DAPO reward manager,overlong buffer 默认关闭,最大回复长度 4096。
  • 数据:GSM8K 格式的 parquet 数据(train.parquet / test.parquet),prompt 最大 1024 token,response 最大 4096 token。
  • 训练配置:单机单 NPU(可扩展),train_batch_size=256ppo_mini_batch_size=16,学习率 1e-6(constant 调度),默认训练 100 步,每 10 步验证/保存 checkpoint。

使用方式

bash run_qwen3_8b_rloo_fsdp_npu.sh \
    --data_path=/path/to/data \
    --model_path=/path/to/Qwen3-8B
  • --data_path:数据目录,必须包含 train.parquettest.parquet
  • --model_path:Qwen3-8B 模型权重目录。
  • 其余参数会以 hydra override 形式透传给 verl.trainer.main_ppo,例如冒烟测试:
bash run_qwen3_8b_rloo_fsdp_npu.sh \
    --data_path=/workspace/data/gsm8k \
    --model_path=/workspace/models \
    data.train_batch_size=16 \
    actor_rollout_ref.actor.ppo_mini_batch_size=4 \
    trainer.total_training_steps=1 \
    trainer.val_before_train=False \
    trainer.test_freq=1000 \
    trainer.save_freq=1000 \
    trainer.log_val_generations=0

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant