Tasks
Post-training
on-policy-self-distillation
Improve On-Policy Self-Distillation methodology within a fixed compute budget.
Alignment
jailbreak-robustness
Post-train Qwen-3-8B to be more robust against jailbreak attacks while remaining helpful.
Applied
agent-swarm-optimization
Autonomously redesign a formalized LLM swarm, to outperform its RL-optimized baselines.
Data
nano-gpt-data-curation
Develop an algorithm to select the best data for pre-training a nanoGPT.