2025-11-22T01:34:16.289617

Reinforce-Ada: An Adaptive Sampling Framework for Reinforce-Style LLM Training

Xiong, Ye, Liao et al.

Reinforcement learning applied to large language models (LLMs) for reasoning tasks is often bottlenecked by unstable gradient estimates due to fixed and uniform sampling of responses across prompts. Prior work such as GVM-RAFT addresses this by dynamically allocating inference budget per prompt to minimize stochastic gradient variance under a budget constraint. Inspired by this insight, we propose Reinforce-Ada, an adaptive sampling framework for online RL post-training of LLMs that continuously reallocates sampling effort to the prompts with the greatest uncertainty or learning potential. Unlike conventional two-stage allocation methods, Reinforce-Ada interleaves estimation and sampling in an online successive elimination process, and automatically stops sampling for a prompt once sufficient signal is collected. To stabilize updates, we form fixed-size groups with enforced reward diversity and compute advantage baselines using global statistics aggregated over the adaptive sampling phase. Empirical results across multiple model architectures and reasoning benchmarks show that Reinforce-Ada accelerates convergence and improves final performance compared to GRPO, especially when using the balanced sampling variant. Our work highlights the central role of variance-aware, adaptive data curation in enabling efficient and reliable reinforcement learning for reasoning-capable LLMs. Code is available at https://github.com/RLHFlow/Reinforce-Ada.

academic

Reinforce-Ada: শক্তিশালী শৈলীর LLM প্রশিক্ষণের জন্য একটি অভিযোজনশীল নমুনা কাঠামো

মৌলিক তথ্য

পেপার আইডি: 2510.04996
শিরোনাম: Reinforce-Ada: An Adaptive Sampling Framework for Reinforce-Style LLM Training
লেখক: Wei Xiong, Chenlu Ye, Baohao Liao, Hanze Dong, Xinxing Xu, Christof Monz, Jiang Bian, Nan Jiang, Tong Zhang
শ্রেণীবিভাগ: cs.LG cs.AI cs.CL stat.ML
প্রকাশনার সময়: ২০২৫ সালের অক্টোবর (arXiv v2)
পেপার লিংক: https://arxiv.org/abs/2510.04996
কোড লিংক: https://github.com/RLHFlow/Reinforce-Ada

সারসংক্ষেপ

বৃহৎ ভাষা মডেল (LLMs) এর যুক্তিসঙ্গত কাজে শক্তিশালী শিক্ষা প্রয়োগ করার সময়, স্থির এবং সমান প্রতিক্রিয়া নমুনা কৌশলের কারণে গ্রেডিয়েন্ট অনুমান অস্থিতিশীল হয়। এই পেপারটি Reinforce-Ada প্রস্তাব করে, যা LLMs এর অনলাইন শক্তিশালী শিক্ষা পরবর্তী প্রশিক্ষণের জন্য একটি অভিযোজনশীল নমুনা কাঠামো যা ক্রমাগত নমুনা প্রচেষ্টা পুনর্বন্টন করে সর্বোচ্চ অনিশ্চয়তা বা শিক্ষার সম্ভাবনা সহ প্রম্পটগুলিতে। ঐতিহ্যবাহী দ্বি-পর্যায়ের বরাদ্দ পদ্ধতির বিপরীতে, Reinforce-Ada অনুমান এবং নমুনা একটি অনলাইন ক্রমিক নির্মূলন প্রক্রিয়ায় জড়িত করে এবং পর্যাপ্ত সংকেত সংগ্রহের পরে প্রম্পটগুলির নমুনা স্বয়ংক্রিয়ভাবে বন্ধ করে। আপডেটগুলি স্থিতিশীল করতে, পদ্ধতিটি নির্দিষ্ট আকারের গোষ্ঠী গঠন করে এবং পুরস্কার বৈচিত্র্য প্রয়োগ করে, অভিযোজনশীল নমুনা পর্যায়ে সংগৃহীত বৈশ্বিক পরিসংখ্যান ব্যবহার করে সুবিধা ভিত্তিরেখা গণনা করে।

গবেষণা পটভূমি এবং প্রেরণা

মূল সমস্যা

গ্রেডিয়েন্ট অনুমান অস্থিতিশীলতা: ঐতিহ্যবাহী শক্তিশালী শিক্ষা পদ্ধতি LLMs প্রশিক্ষণে নমুনার জন্য স্থির ছোট নমুনা সংখ্যা (n) ব্যবহার করে, যা গ্রেডিয়েন্ট অনুমান বৈচিত্র্য বৃদ্ধি করে এবং প্রশিক্ষণ অস্থিতিশীল করে।
সংকেত সংকোচন সমস্যা: যখন একটি প্রম্পটের সমস্ত n প্রতিক্রিয়া একই পুরস্কার পায় (সম্পূর্ণ সঠিক বা সম্পূর্ণ ভুল), GRPO তে সুবিধা গণনা শূন্য গ্রেডিয়েন্ট তৈরি করে, যা প্রশিক্ষণ সংকেত হারায়।
নমুনা দক্ষতা হ্রাস: সমান নমুনা কৌশল প্রম্পটের কঠিনতা এবং শিক্ষার মূল্য অনুযায়ী গণনা সম্পদ গতিশীলভাবে বরাদ্দ করতে পারে না।

সমস্যার গুরুত্ব

গণিত যুক্তিসঙ্গত কাজে, ৫০% এর বেশি প্রম্পট "শূন্য গ্রেডিয়েন্ট" অবস্থায় পড়ে
সাধারণ নমুনা সংখ্যা বৃদ্ধি সমস্যা প্রশমিত করতে পারে কিন্তু গণনা খরচ অত্যধিক (যেমন n=512 এ খরচ বৃদ্ধি)
বিদ্যমান প্যাসিভ ফিল্টারিং পদ্ধতি অনেক উৎপাদিত প্রতিক্রিয়া পরিত্যাগ করে, সম্পদ অপচয় করে

বিদ্যমান পদ্ধতির সীমাবদ্ধতা

GRPO এর স্থির নমুনা: বিভিন্ন প্রম্পটের কঠিনতা পার্থক্যের সাথে খাপ খাইয়ে নিতে পারে না
প্যাসিভ ফিল্টারিং পদ্ধতি: অনেক অপ্রয়োজনীয় প্রতিক্রিয়া উৎপাদন করে তারপর পরিত্যাগ করে, দক্ষতা কম
দ্বি-পর্যায়ের বাজেট বরাদ্দ: GVM-RAFT এর মতো পদ্ধতি অনুমান এবং নমুনা আলাদা করে, দক্ষতা কম এবং অনলাইন বাস্তবায়ন কঠিন

মূল অবদান

Reinforce-Ada অভিযোজনশীল নমুনা কাঠামো প্রস্তাব: অনুমান এবং নমুনা একটি অনলাইন ক্রমিক নির্মূলন প্রক্রিয়ায় একীভূত করে, যুক্তিসঙ্গত বাজেট গতিশীলভাবে বরাদ্দ করে
দুটি প্রস্থান শর্ত ডিজাইন:
- Reinforce-Ada-pos: ইতিবাচক নমুনা সংগ্রহে ফোকাস করে
- Reinforce-Ada-balance: ইতিবাচক এবং নেতিবাচক নমুনা ভারসাম্য রাখে, অন্বেষণ বজায় রাখে
বৈশ্বিক পরিসংখ্যান স্বাভাবিকীকরণ প্রবর্তন: সম্পূর্ণ নমুনা প্রক্রিয়ার পরিসংখ্যান ব্যবহার করে সুবিধা গণনা করে, অনুমান স্থিতিশীলতা উন্নত করে
তাৎক্ষণিক প্লাগ-এন্ড-প্লে প্রতিস্থাপন বাস্তবায়ন: বিদ্যমান RL পাইপলাইনে উৎপাদন পদক্ষেপ সরাসরি প্রতিস্থাপন করতে পারে, স্থাপত্য সংশোধন প্রয়োজন নেই
একাধিক মডেল এবং বেঞ্চমার্কে কার্যকারিতা যাচাই: গণিত যুক্তিসঙ্গত কাজে ক্রমাগত সংযোগ গতি এবং চূড়ান্ত কর্মক্ষমতা উন্নত করে

পদ্ধতি বিস্তারিত

কাজের সংজ্ঞা

প্রম্পট বিতরণ d₀ দেওয়া, নীতি πθ প্রতিক্রিয়া উৎপাদন করে a～πθ(·|x), যাচাইকারী পুরস্কার r⋆(x,a)∈{0,1} প্রদান করে। লক্ষ্য প্রত্যাশিত পুরস্কার সর্বাধিক করা:

J(θ) = E_{x∼d₀,a∼πθ(·|x)}r⋆(x,a)

মূল অ্যালগরিদম স্থাপত্য

1. অভিযোজনশীল নমুনা প্রক্রিয়া

অ্যালগরিদম প্রবাহ:
1. আরম্ভকরণ: সমস্ত প্রম্পট সক্রিয় হিসাবে চিহ্নিত
2. বহু-রাউন্ড নমুনা:
   - প্রতিটি সক্রিয় প্রম্পটের জন্য M প্রতিক্রিয়া নমুনা করুন
   - প্রস্থান শর্ত মূল্যায়ন করুন
   - শর্ত পূরণকারী প্রম্পট নিষ্ক্রিয় হিসাবে চিহ্নিত করুন
3. সমস্ত প্রম্পট প্রস্থান না হওয়া পর্যন্ত বা সর্বাধিক রাউন্ড N পৌঁছানো পর্যন্ত পুনরাবৃত্তি করুন

2. প্রস্থান শর্ত ডিজাইন

Reinforce-Ada-pos: কমপক্ষে একটি সঠিক প্রতিক্রিয়া সংগ্রহ করলে প্রস্থান করুন
Reinforce-Ada-balance: কমপক্ষে n/2 সঠিক এবং n/2 ভুল প্রতিক্রিয়া সংগ্রহ করলে প্রস্থান করুন

3. প্রশিক্ষণ ব্যাচ নির্মাণ

প্রতিটি প্রম্পটের প্রতিক্রিয়া পুল থেকে নির্দিষ্ট আকারে ডাউন-নমুনা করুন
ইতিবাচক এবং নেতিবাচক নমুনা ভারসাম্য অগ্রাধিকার দিন (প্রতিটি n/2)
বৈশ্বিক পরিসংখ্যান ব্যবহার করে সুবিধা গণনা করুন: A(x,aᵢ) = rᵢ - r̄

4. উদ্দেশ্য ফাংশন

গুরুত্ব নমুনা সংশোধন এবং PPO শৈলী গ্রেডিয়েন্ট ক্লিপিং ব্যবহার করুন:

L(θ) = 1/|B| ∑{(x,aᵢ)∈B} ∑^{|aᵢ|} min(ρᵢ,t·A(x,aᵢ), clip(ρᵢ,t, 1-ε_, 1+ε_)·A(x,aᵢ))

প্রযুক্তিগত উদ্ভাবন পয়েন্ট

অনলাইন একীভূত প্রক্রিয়া: ঐতিহ্যবাহী দ্বি-পর্যায়ের পদ্ধতির অনুমান এবং সিদ্ধান্ত একটি একক অনলাইন প্রক্রিয়ায় একত্রিত করুন
ক্রমিক নির্মূলন প্রক্রিয়া: মাল্টি-আর্মড ব্যান্ডিট চিন্তাভাবনা ধার করুন, গতিশীলভাবে অতিরিক্ত নমুনার প্রয়োজন নেই এমন প্রম্পট বন্ধ করুন
বৈশ্বিক স্বাভাবিকীকরণ কৌশল: চূড়ান্ত নির্বাচিত উপসেটের পরিবর্তে সম্পূর্ণ নমুনা পুলের পরিসংখ্যান ব্যবহার করুন, অনুমান শক্তিশালীতা উন্নত করুন
ভারসাম্যপূর্ণ নমুনা নিশ্চিতকরণ: প্রতিটি প্রশিক্ষণ গোষ্ঠীতে অ-শূন্য বৈচিত্র্য নিশ্চিত করুন, গ্রেডিয়েন্ট অদৃশ্যতা এড়ান

পরীক্ষামূলক সেটআপ

ডেটাসেট

প্রশিক্ষণ ডেটা: OpenR1-Math-220k ডেটাসেটের ডিফল্ট উপসেট
প্রাক-প্রক্রিয়াকরণ: ডুপ্লিকেট অপসারণ, যাচাইকরণ ফিল্টারিং, মধ্যম কঠিনতা নির্বাচন (16 নমুনায় কমপক্ষে 1 সঠিক)

মডেল

Qwen2.5-Math-7B/1.5B
Qwen3-4B-it
Llama-3.2-3B-it

মূল্যায়ন মেট্রিক্স

প্রশিক্ষণ মেট্রিক্স: পুরস্কার বক্ররেখা, এন্ট্রপি পরিবর্তন
পরীক্ষা বেঞ্চমার্ক: MATH500, Minerva Math, OlympiadBench, AIME-like
মূল্যায়ন পদ্ধতি: Ave@32 (তাপমাত্রা 1.0, সর্বাধিক 4096 টোকেন)

বাস্তবায়ন বিবরণ

ব্যাচ আকার: 512 প্রম্পট
কার্যকর গোষ্ঠী আকার: n=4
সর্বাধিক নমুনা সংখ্যা: 32 প্রতিক্রিয়া/প্রম্পট
শিক্ষার হার: 1×10⁻⁶ (AdamW)
এন্ট্রপি নিয়মিতকরণ: 1×10⁻⁴
প্রশিক্ষণ পদক্ষেপ: 600 পদক্ষেপ

পরীক্ষামূলক ফলাফল

প্রধান ফলাফল

প্রশিক্ষণ দক্ষতা উন্নতি

সংযোগ গতি: Reinforce-Ada প্রথম 50-150 পদক্ষেপে স্পষ্ট সুবিধা দেখায়
চূড়ান্ত কর্মক্ষমতা: সমস্ত পরীক্ষা মডেলে উচ্চতর পুরস্কার সীমা অর্জন করে
স্থিতিশীলতা: Reinforce-Ada-balance সবচেয়ে স্থিতিশীল কর্মক্ষমতা দেখায়

পরীক্ষা বেঞ্চমার্ক কর্মক্ষমতা

মডেল	পদ্ধতি	Math500	Minerva	Olympiad	AIME-like	ওজনযুক্ত গড়
Qwen2.5-Math-1.5B	GRPO	74.2	34.4	38.4	16.2	45.3
	Reinforce-Ada-balance	77.4	36.5	40.5	17.5	47.6 (+2.3)
Qwen2.5-Math-7B	GRPO	82.2	44.7	45.6	23.2	53.3
	Reinforce-Ada-balance	84.0	45.2	47.1	23.7	54.6 (+1.3)

বিলোপন পরীক্ষা

ভারসাম্যপূর্ণ নমুনার গুরুত্ব

Reinforce-Ada-balance ক্রমাগত Reinforce-Ada-pos এর চেয়ে ভাল
প্রশিক্ষণের পরবর্তী পর্যায়ে, ভারসাম্যপূর্ণ নমুনা অন্বেষণ বজায় রাখে, এন্ট্রপি সংকোচন এড়ায়

গণনা ওভারহেড বিশ্লেষণ

মডেল	পদ্ধতি	গড় পদক্ষেপ সময় (সেকেন্ড)	আপেক্ষিক খরচ
Qwen2.5-Math-1.5B	GRPO	102	1.0×
	Reinforce-Ada-balance	290	2.8×
Qwen2.5-Math-7B	GRPO	236	1.0×
	Reinforce-Ada-balance	375	1.59×

প্রম্পট কঠিনতা প্রভাব

কঠিন প্রম্পট সেটে, Reinforce-Ada এর সুবিধা আরও স্পষ্ট
সহজ প্রম্পট সেটে সুবিধা তুলনামূলকভাবে ছোট, কারণ বেশিরভাগ প্রম্পট প্রথম দুই রাউন্ডে প্রস্থান শর্ত পূরণ করে

নমুনা গতিশীলতা বিশ্লেষণ

প্রাথমিক প্রশিক্ষণ: প্রধান বাধা ইতিবাচক নমুনার অভাব, Reinforce-Ada-pos এবং balance উভয়ই কার্যকর
পরবর্তী প্রশিক্ষণ: বাধা নেতিবাচক নমুনার অভাবে রূপান্তরিত হয়, balance সংস্করণ সুবিধা স্পষ্ট
অভিযোজনশীল বরাদ্দ: কঠিন প্রম্পট আরও নমুনা বাজেট পায়, সহজ প্রম্পট তাড়াতাড়ি প্রস্থান করে

উপসংহার এবং আলোচনা

প্রধান উপসংহার

অভিযোজনশীল নমুনা কার্যকর: স্থির নমুনা কৌশলের তুলনায় প্রশিক্ষণ দক্ষতা এবং চূড়ান্ত কর্মক্ষমতা উল্লেখযোগ্যভাবে উন্নত করে
ভারসাম্যপূর্ণ নমুনা মূল: ইতিবাচক এবং নেতিবাচক নমুনা ভারসাম্য বজায় রাখা অন্বেষণ বজায় রাখতে এবং অতিফিটিং এড়াতে গুরুত্বপূর্ণ
তাৎক্ষণিক প্লাগ-এন্ড-প্লে ব্যবহারিক: বিদ্যমান RL প্রশিক্ষণ কাঠামোতে সরাসরি একীভূত করা যায়

সীমাবদ্ধতা

গণনা ওভারহেড: GRPO এর তুলনায় 1.5-2.8 গুণ গণনা খরচ বৃদ্ধি
ডোমেইন সীমাবদ্ধতা: পরীক্ষা প্রধানত গণিত যুক্তিসঙ্গত ক্ষেত্রে কেন্দ্রীভূত
প্রম্পট কঠিনতা নির্ভরতা: সহজ প্রম্পট প্রাধান্য পায় এমন ডেটাসেটে সুবিধা সীমিত
হাইপারপ্যারামিটার সংবেদনশীলতা: সর্বাধিক রাউন্ড N এবং প্রতি রাউন্ড নমুনা সংখ্যা M যুক্তিসঙ্গতভাবে সেট করার প্রয়োজন

ভবিষ্যত দিকনির্দেশনা

সম্পূর্ণ প্রবাহ ডেটা ব্যবস্থাপনা: পাঠ্যক্রম শিক্ষা ইত্যাদি ম্যাক্রো কৌশল একত্রিত করুন
বহু-ডোমেইন যাচাইকরণ: কোড উৎপাদন, সংলাপ ইত্যাদি অন্যান্য কাজে প্রসারিত করুন
তাত্ত্বিক বিশ্লেষণ: সংযোগ এবং নমুনা জটিলতার তাত্ত্বিক গ্যারান্টি প্রদান করুন
দক্ষতা অপ্টিমাইজেশান: আরও দক্ষ প্রস্থান শর্ত এবং নমুনা কৌশল গবেষণা করুন

গভীর মূল্যায়ন

সুবিধা

সমস্যা অবস্থান নির্ভুল: GRPO তে সংকেত সংকোচনের মূল কারণ স্পষ্টভাবে চিহ্নিত করে
পদ্ধতি ডিজাইন চতুর: মাল্টি-আর্মড ব্যান্ডিট চিন্তাভাবনা LLM প্রশিক্ষণে সৃজনশীলভাবে প্রয়োগ করে
পরীক্ষা পর্যাপ্ত: একাধিক মডেল, একাধিক বেঞ্চমার্কের ব্যাপক যাচাইকরণ
প্রকৌশল বান্ধব: তাৎক্ষণিক প্লাগ-এন্ড-প্লে বাস্তবায়ন প্রদান করে, ব্যবহারিক প্রয়োগ সহজ করে
বিশ্লেষণ গভীর: বিস্তারিত গতিশীলতা বিশ্লেষণ এবং বিলোপন পরীক্ষা

অপূর্ণতা

তাত্ত্বিক ভিত্তি দুর্বল: সংযোগ ইত্যাদি তাত্ত্বিক বিশ্লেষণের অভাব
খরচ-সুবিধা ভারসাম্য: গণনা ওভারহেড বৃদ্ধি মূল্যবান কিনা আরও বিশ্লেষণ প্রয়োজন
প্রয়োগযোগ্য পরিসীমা সীমিত: প্রধানত গণিত যুক্তিসঙ্গতে যাচাই করা হয়, সাধারণীকরণ অনিশ্চিত
প্যারামিটার সমন্বয় জটিল: অতিরিক্ত হাইপারপ্যারামিটার প্রবর্তন করে যা সমন্বয় প্রয়োজন

প্রভাব

একাডেমিক মূল্য: LLM শক্তিশালী শিক্ষার জন্য নতুন ডেটা নমুনা দৃষ্টিভঙ্গি প্রদান করে
ব্যবহারিক মূল্য: বিদ্যমান প্রশিক্ষণ প্রবাহে সরাসরি প্রয়োগ করা যায়
অনুপ্রেরণা তাৎপর্য: RL তে অভিযোজনশীল ডেটা ব্যবস্থাপনা প্রয়োগ চালিত করে

প্রযোজ্য পরিস্থিতি

উচ্চ মানের প্রয়োজনীয়তা: মডেল কর্মক্ষমতার উচ্চ প্রয়োজনীয়তা সহ অ্যাপ্লিকেশন
পর্যাপ্ত গণনা সম্পদ: অতিরিক্ত গণনা খরচ সহ্য করতে পারে এমন পরিস্থিতি
যুক্তিসঙ্গত কাজ: বিশেষত গণিত যুক্তিসঙ্গত, কোড উৎপাদন ইত্যাদি বহু-পদক্ষেপ যুক্তিসঙ্গতের প্রয়োজন এমন কাজের জন্য উপযুক্ত
অনলাইন প্রশিক্ষণ: প্রশিক্ষণ কৌশল গতিশীলভাবে সামঞ্জস্য করার প্রয়োজন এমন পরিস্থিতি

সংদর্ভ

Shao et al. (2024). DeepSeekMath: Pushing the limits of mathematical reasoning in open language models.
Yao et al. (2025). Optimizing chain-of-thought reasoners via gradient variance minimization in rejection sampling and rl.
Yu et al. (2025). Dapo: An open-source llm reinforcement learning system at scale.
Slivkins et al. (2019). Introduction to multi-armed bandits.
Dong et al. (2023). RAFT: Reward ranked finetuning for generative foundation model alignment.

সারসংক্ষেপ: Reinforce-Ada একটি উদ্ভাবনী অভিযোজনশীল নমুনা কাঠামো প্রস্তাব করে যা LLM শক্তিশালী শিক্ষায় সংকেত সংকোচন সমস্যা কার্যকরভাবে সমাধান করে। যদিও গণনা খরচ বৃদ্ধি করে, তবে প্রশিক্ষণ দক্ষতা এবং চূড়ান্ত কর্মক্ষমতায় উল্লেখযোগ্য উন্নতি করে, LLM শক্তিশালী শিক্ষা প্রশিক্ষণের জন্য মূল্যবান নতুন চিন্তাভাবনা প্রদান করে।