LoRA adapter from supervised fine-tuning of Qwen/Qwen3.5-27B on the ZhuofengLi/hardtests-sft-qwen3.5-27b dataset (reward=1 competitive-programming trajectories with reasoning).
Fuente del modelo
Descripción de la fuente
LoRA adapter from supervised fine-tuning of Qwen/Qwen3.5-27B on the
ZhuofengLi/hardtests-sft-qwen3.5-27b
dataset (reward=1 competitive-programming trajectories with reasoning).
Fuentes
1 fuenteVerificado 30 ago
Artefactos del modelo
1 artefactoExtractos de fuentes
2 extractosadapter_config.json)from transformers import AutoModelForCausalLM, AutoTokenizer
from peft import PeftModel
base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3.5-27B", torch_dtype="bfloat16", device_map="auto")
model = PeftModel.from_pretrained(base, "ZhuofengLi/hardtests-sft-qwen3.5-27b-r16-epoch2")
model = model.merge_and_unload()
model.save_pretrained("./qwen3.5-27b-hardtests-sft-epoch2-merged")
AutoTokenizer.from_pretrained("Qwen/Qwen3.5-27B").save_pretrained("./qwen3.5-27b-hardtests-sft-epoch2-merged")
--- base_model: Qwen/Qwen3.5-27B library_name: peft tags: - lora - sft - qwen3.5 - hardtests - competitive-programming --- # HardTests SFT — Qwen3.5-27B LoRA (epoch 2) LoRA adapter from supervised fine-tuning of `Qwen/Qwen3.5-27B` on the [ZhuofengLi/hardtests-sft-qwen3.5-27b](https://huggingface.co/datasets/ZhuofengLi/hardtests-sft-qwen3.5-27b) dataset (reward=1 competitive-programming trajectories with reasoning). - **Checkpoint**: step 180 (recorded epoch = 2.022711142654365) - **LoRA**: r=8, alpha=32 (see `adapter_config.json`) - **Contents**: adapter weights + configs only (no optimizer state) ## Merge into the base model ```python from transformers import AutoModelForCausalLM, AutoTokenizer from peft import PeftModel base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3.5-27B", torch_dtype="bfloat16", device_map="auto") model = PeftModel.from_pretrained(base, "ZhuofengLi/hardtests-sft-qwen3.5-27b-r16-epoch2") model = model.merge_and_unload() model.save_pretrained("./qwen3.5-27b-hardtests-sft-epoch2-merged") AutoTokenizer.from_pretrained("Qwen/Qwen3.5-27B").save_pretrained("./qwen3.5-27b-hardtests-sft-epoch2-merged") ```
Source context: 1 downloads · 0 likes · Library peft · Repo ZhuofengLi/hardtests-sft-qwen3.5-27b-r16-epoch2