Skip to content
on-policy-self-distillation

gpt-5.6-sol

on-policy-self-distillation — graded by the task's verifier against a measured baseline.

backend
modal
variant
codex azure_ai/gpt-5.6-sol
metric
AIME24 avg@12 accuracy
actions
636
duration
8h 10m
recorded
2026-08-03

run idopsd-aime24-4gpus__3tyLi4e

Everything gpt-5.6-sol did on this task, in order.

download JSON ↗
codexgpt-5.6-sol683 turns47 narration636 reasoning636 action636 observation1 final
#51
reasoning (redacted)

encrypted chain-of-thought — recorded, not exposed

toolwait
args
{
  "cell_id": "37",
  "yield_time_ms": 50000,
  "max_tokens": 500
}
wait result
Script completed
Wall time 32.1 seconds
Output:
Warning: truncated output (original token count: 527)
Total output lines: 24

Warning: truncated output (original token count: 1921)
Total output lines: 67

vLLM generation done - elapsed time: 3.70s, prompts: 4, total tokens: 3602, avg length: 900.5, speed: 974.2 tok/s
vLLM generation done - elapsed time: 3.71s, prompts: 4, total tokens: 3649, avg length: 912.2, speed: 984.1 tok/s
vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 3695, avg length: 923.8, speed: 991.9 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 3952, avg length: 988.0, speed: 1055.5 tok/s
vLLM generation done - elapsed time: 3.66s, prompts: 4, total tokens: 3638, avg length: 909.5, speed: 994.6 tok/s
vLLM generation done - elapsed time: 3.71s, prompts: 4, total tokens: 3403, avg length: 850.8, speed: 916.2 tok/s
vLLM generation done - elapsed time: 3.72s, prompts: 4, total tokens: 3557, avg length: 889.2, speed: 956.8 tok/s
vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 3759, avg length: 939.8, speed: 1006.7 tok/s
…27 tokens truncated…time: 3.73s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1098.4 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 3785, avg length: 946.2, speed: 1012.3 tok/s

================================================================================
Saved 40 generation outputs to:
  /workspace/runs/frontier_v1/capped_seed42/generations/generations_step_30.json
================================================================================


 31%|███       | 31/100 [04:35<10:14,  8.90s/it]vLLM generation done - elapsed time: 3.62s, prompts: 4, total tokens: 3031, avg length: 757.8, speed: 837.6 tok/s
vLLM generation done - elapsed time: 3.66s, prompts: 4, total tokens: 3013, avg length: 753.2, speed: 823.2 tok/s
vLLM generation done - elapsed time: 3.69s, prompts: 4, total tokens: 3175, avg length: 793.8, speed: 860.4 tok/s
vLLM generation done - elapsed time: 3.72s, prompts: 4, total tokens: 3651, avg length: 912.8, speed: 982.2 tok/s
#52
narration

At roughly one-third of training, rollout accuracy continues to fluctuate around the expected frontier (roughly 20–60% per small logging window), while gradient norms have already fallen below the 0.1 cap in most windows. That indicates the correctness term is not overwhelming the KL objective; I’ll use the full evaluation, not these noisy training statistics, to decide whether the curriculum is too narrow.

#53
reasoning (redacted)

encrypted chain-of-thought — recorded, not exposed

toolexec
args
{
  "input": "const r = await tools.write_stdin({session_id:35523,chars:\"\",yield_time_ms:50000,max_output_tokens:450});\ntext(r.output);"
}
exec result
Script running with cell ID 38
Wall time 11.0 seconds
Output:
#54
reasoning (redacted)

encrypted chain-of-thought — recorded, not exposed

toolwait
args
{
  "cell_id": "38",
  "yield_time_ms": 50000,
  "max_tokens": 450
}
wait result
Script completed
Wall time 30.8 seconds
Output:
Warning: truncated output (original token count: 477)
Total output lines: 16

Warning: truncated output (original token count: 1938)
Total output lines: 63

vLLM generation done - elapsed time: 3.65s, prompts: 4, total tokens: 2847, avg length: 711.8, speed: 779.6 tok/s
vLLM generation done - elapsed time: 3.69s, prompts: 4, total tokens: 3310, avg length: 827.5, speed: 897.3 tok/s
vLLM generation done - elapsed time: 3.69s, prompts: 4, total tokens: 3696, avg length: 924.0, speed: 1000.4 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1092.8 tok/s

 32%|███▏      | 32/100 [04:44<10:03,  8.88s/it]
                                                
{'loss': 0.0013, 'grad_norm': 0.06294427067041397, 'learning_rate': 3.45e-06, 'on_policy_loss': 0.0013, 'rollout_accuracy': 0.125, 'epoch': 0.12}

 32%|███▏      | 32/100 [04:44<10:03,  8.88s/it]vLLM generation done - elapsed time: 3.77s, pro…27 tokens truncated…generation done - elapsed time: 3.76s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1088.0 tok/s
vLLM generation done - elapsed time: 3.68s, prompts: 4, total tokens: 3066, avg length: 766.5, speed: 832.8 tok/s
vLLM generation done - elapsed time: 3.71s, prompts: 4, total tokens: 3524, avg length: 881.0, speed: 949.9 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 3800, avg length: 950.0, speed: 1017.3 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 3970, avg length: 992.5, speed: 1057.1 tok/s

 38%|███▊      | 38/100 [05:38<09:15,  8.96s/it]
                                                
{'loss': -0.0004, 'grad_norm': 0.04886931553483009, 'learning_rate': 3.1500000000000003e-06, 'on_policy_loss': -0.0004, 'rollout_accuracy': 0.25, 'epoch': 0.14}

 38%|███▊      | 38/100 [05:38<09:15,  8.96s/it]
#55
reasoning (redacted)

encrypted chain-of-thought — recorded, not exposed

toolexec
args
{
  "input": "const r = await tools.write_stdin({session_id:35523,chars:\"\",yield_time_ms:50000,max_output_tokens:400});\ntext(r.output);"
}
exec result
Script running with cell ID 39
Wall time 11.0 seconds
Output:
#56
reasoning (redacted)

encrypted chain-of-thought — recorded, not exposed

toolwait
args
{
  "cell_id": "39",
  "yield_time_ms": 50000,
  "max_tokens": 400
}
wait result
Script completed
Wall time 31.7 seconds
Output:
Warning: truncated output (original token count: 427)
Total output lines: 15

Warning: truncated output (original token count: 1859)
Total output lines: 61

vLLM generation done - elapsed time: 3.69s, prompts: 4, total tokens: 3298, avg length: 824.5, speed: 893.1 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 3780, avg length: 945.0, speed: 1011.6 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 3821, avg length: 955.2, speed: 1020.1 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1088.2 tok/s
vLLM generation done - elapsed time: 3.68s, prompts: 4, total tokens: 3065, avg length: 766.2, speed: 832.2 tok/s
vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 3636, avg length: 909.0, speed: 975.0 tok/s
vLLM generation done - elap…27 tokens truncated…ed: 1087.1 tok/s

 44%|████▍     | 44/100 [06:32<08:18,  8.91s/it]
                                                
{'loss': 0.0011, 'grad_norm': 0.09780632704496384, 'learning_rate': 2.85e-06, 'on_policy_loss': 0.0011, 'rollout_accuracy': 0.4375, 'epoch': 0.16}

 44%|████▍     | 44/100 [06:32<08:18,  8.91s/it]vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 3635, avg length: 908.8, speed: 970.0 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1091.0 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1088.4 tok/s
vLLM generation done - elapsed time: 3.77s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1085.1 tok/s
#57
reasoning (redacted)

encrypted chain-of-thought — recorded, not exposed

toolexec
args
{
  "input": "const r = await tools.write_stdin({session_id:35523,chars:\"\",yield_time_ms:50000,max_output_tokens:400});\ntext(r.output);"
}
exec result
Script running with cell ID 40
Wall time 11.0 seconds
Output:
#58
reasoning (redacted)

encrypted chain-of-thought — recorded, not exposed

toolwait
args
{
  "cell_id": "40",
  "yield_time_ms": 50000,
  "max_tokens": 400
}
wait result
Script completed
Wall time 29.2 seconds
Output:
Warning: truncated output (original token count: 427)
Total output lines: 20

Warning: truncated output (original token count: 1948)
Total output lines: 68

vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 3828, avg length: 957.0, speed: 1026.9 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 3714, avg length: 928.5, speed: 993.4 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 4006, avg length: 1001.5, speed: 1068.6 tok/s
vLLM generation done - elapsed time: 3.77s, prompts: 4, total tokens: 4080, avg length: 1020.0, speed: 1082.6 tok/s

 45%|████▌     | 45/100 [06:41<08:09,  8.90s/it]vLLM generation done - elapsed time: 3.60s, prompts: 4, total tokens: 3045, avg length: 761.2, speed: 845.1 tok/s
vLLM generation done - elapsed time: 3.70s, prompts: 4, total tokens: 3364, avg le…27 tokens truncated… generation done - elapsed time: 3.77s, prompts: 4, total tokens: 3618, avg length: 904.5, speed: 960.6 tok/s
vLLM generation done - elapsed time: 3.77s, prompts: 4, total tokens: 3500, avg length: 875.0, speed: 928.2 tok/s
vLLM generation done - elapsed time: 3.78s, prompts: 4, total tokens: 3974, avg length: 993.5, speed: 1050.2 tok/s
vLLM generation done - elapsed time: 3.79s, prompts: 4, total tokens: 3901, avg length: 975.2, speed: 1029.8 tok/s

================================================================================
Saved 40 generation outputs to:
  /workspace/runs/frontier_v1/capped_seed42/generations/generations_step_50.json
================================================================================


 51%|█████     | 51/100 [07:34<07:19,  8.97s/it]
#59
reasoning (redacted)

encrypted chain-of-thought — recorded, not exposed

toolexec
args
{
  "input": "const r = await tools.write_stdin({session_id:35523,chars:\"\",yield_time_ms:50000,max_output_tokens:350});\ntext(r.output);"
}
exec result
Script running with cell ID 41
Wall time 11.0 seconds
Output:
#60
reasoning (redacted)

encrypted chain-of-thought — recorded, not exposed

toolwait
args
{
  "cell_id": "41",
  "yield_time_ms": 50000,
  "max_tokens": 350
}
wait result
Script completed
Wall time 30.6 seconds
Output:
Warning: truncated output (original token count: 377)
Total output lines: 15

Warning: truncated output (original token count: 3068)
Total output lines: 189

vLLM generation done - elapsed time: 3.77s, prompts: 4, total tokens: 3348, avg length: 837.0, speed: 887.5 tok/s
vLLM generation done - elapsed time: 3.79s, prompts: 4, total tokens: 3888, avg length: 972.0, speed: 1026.4 tok/s
vLLM generation done - elapsed time: 3.82s, prompts: 4, total tokens: 3927, avg length: 981.8, speed: 1029.2 tok/s
vLLM generation done - elapsed time: 3.82s, prompts: 4, total tokens: 3975, avg length: 993.8, speed: 1040.8 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 3374, avg length: 843.5, speed: 900.0 tok/s
vLLM generation done - elapsed time: 3.77s…27 tokens truncated…al tokens: 4096, avg length: 1024.0, speed: 1086.2 tok/s
vLLM generation done - elapsed time: 3.79s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1080.6 tok/s

 57%|█████▋    | 57/100 [08:28<06:25,  8.96s/it]vLLM generation done - elapsed time: 3.72s, prompts: 4, total tokens: 3350, avg length: 837.5, speed: 901.7 tok/s
vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 3678, avg length: 919.5, speed: 986.8 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 4032, avg length: 1008.0, speed: 1071.0 tok/s
vLLM generation done - elapsed time: 3.78s, prompts: 4, total tokens: 4049, avg length: 1012.2, speed: 1071.2 tok/s
#61
reasoning (redacted)

encrypted chain-of-thought — recorded, not exposed

toolexec
args
{
  "input": "const r = await tools.write_stdin({session_id:35523,chars:\"\",yield_time_ms:50000,max_output_tokens:350});\ntext(r.output);"
}
exec result
Script running with cell ID 42
Wall time 11.0 seconds
Output:
#62
reasoning (redacted)

encrypted chain-of-thought — recorded, not exposed

toolwait
args
{
  "cell_id": "42",
  "yield_time_ms": 50000,
  "max_tokens": 350
}
wait result
Script completed
Wall time 31.9 seconds
Output:
Warning: truncated output (original token count: 377)
Total output lines: 13

Warning: truncated output (original token count: 1950)
Total output lines: 63

vLLM generation done - elapsed time: 3.72s, prompts: 4, total tokens: 3380, avg length: 845.0, speed: 907.8 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 4053, avg length: 1013.2, speed: 1082.1 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 3746, avg length: 936.5, speed: 997.5 tok/s
vLLM generation done - elapsed time: 3.77s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1086.7 tok/s

 58%|█████▊    | 58/100 [08:37<06:15,  8.95s/it]
                                                
{'loss': -0.0009, 'grad_norm': 0.0543122440576…27 tokens truncated…14.2, speed: 691.3 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 3968, avg length: 992.0, speed: 1061.6 tok/s
vLLM generation done - elapsed time: 3.77s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1085.4 tok/s
vLLM generation done - elapsed time: 3.77s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1085.1 tok/s

 64%|██████▍   | 64/100 [09:31<05:22,  8.95s/it]
                                                
{'loss': -0.0019, 'grad_norm': 0.06151019409298897, 'learning_rate': 1.85e-06, 'on_policy_loss': -0.0019, 'rollout_accuracy': 0.25, 'epoch': 0.23}

 64%|██████▍   | 64/100 [09:31<05:22,  8.95s/it]
#63
narration

The run is now past step 60 and remains numerically stable. As expected from the paper’s one-sided vocabulary clipping, the aggregate clipped objective has crossed slightly below zero late in training; gradients remain finite and modest. The checkpoint should be ready in about six minutes, after which I’ll run the full 30×12 evaluation.

#64
reasoning (redacted)

encrypted chain-of-thought — recorded, not exposed

toolexec
args
{
  "input": "const r = await tools.write_stdin({session_id:35523,chars:\"\",yield_time_ms:50000,max_output_tokens:300});\ntext(r.output);"
}
exec result
Script running with cell ID 43
Wall time 11.0 seconds
Output:
#65
reasoning (redacted)

encrypted chain-of-thought — recorded, not exposed

toolwait
args
{
  "cell_id": "43",
  "yield_time_ms": 50000,
  "max_tokens": 300
}
wait result
Script completed
Wall time 35.5 seconds
Output:
Warning: truncated output (original token count: 327)
Total output lines: 13

Warning: truncated output (original token count: 1758)
Total output lines: 58

vLLM generation done - elapsed time: 3.65s, prompts: 4, total tokens: 2849, avg length: 712.2, speed: 779.7 tok/s
vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 3658, avg length: 914.5, speed: 979.5 tok/s
vLLM generation done - elapsed time: 3.77s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1085.5 tok/s
vLLM generation done - elapsed time: 3.78s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1083.5 tok/s
vLLM generation done - elapsed time: 3.71s, prompts: 4, t…27 tokens truncated… 896.0, speed: 959.2 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 3595, avg length: 898.8, speed: 961.5 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 4015, avg length: 1003.8, speed: 1072.8 tok/s

 70%|███████   | 70/100 [10:24<04:26,  8.88s/it]
                                                
{'loss': -0.0024, 'grad_norm': 0.07535967230796814, 'learning_rate': 1.5500000000000002e-06, 'on_policy_loss': -0.0024, 'rollout_accuracy': 0.3125, 'epoch': 0.25}

 70%|███████   | 70/100 [10:24<04:26,  8.88s/it]
#66
reasoning (redacted)

encrypted chain-of-thought — recorded, not exposed

toolexec
args
{
  "input": "const r = await tools.write_stdin({session_id:35523,chars:\"\",yield_time_ms:50000,max_output_tokens:300});\ntext(r.output);"
}
exec result
Script running with cell ID 44
Wall time 11.0 seconds
Output:
#67
reasoning (redacted)

encrypted chain-of-thought — recorded, not exposed

toolwait
args
{
  "cell_id": "44",
  "yield_time_ms": 50000,
  "max_tokens": 300
}
wait result
Script completed
Wall time 36.2 seconds
Output:
Warning: truncated output (original token count: 327)
Total output lines: 14

Warning: truncated output (original token count: 2079)
Total output lines: 72

vLLM generation done - elapsed time: 3.70s, prompts: 4, total tokens: 3468, avg length: 867.0, speed: 937.8 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 3836, avg length: 959.0, speed: 1022.7 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 3811, avg length: 952.8, speed: 1015.7 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 3979, avg length: 994.8, speed: 1058.9 tok/s
vLLM generation done - elapsed time: 3.67s, prompts: 4, to…27 tokens truncated…prompts: 4, total tokens: 4065, avg length: 1016.2, speed: 1083.2 tok/s
vLLM generation done - elapsed time: 3.62s, prompts: 4, total tokens: 2760, avg length: 690.0, speed: 762.1 tok/s
vLLM generation done - elapsed time: 3.70s, prompts: 4, total tokens: 3335, avg length: 833.8, speed: 900.7 tok/s
vLLM generation done - elapsed time: 3.71s, prompts: 4, total tokens: 3385, avg length: 846.2, speed: 911.6 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1093.3 tok/s

 77%|███████▋  | 77/100 [11:27<03:24,  8.87s/it]
#68
reasoning (redacted)

encrypted chain-of-thought — recorded, not exposed

toolexec
args
{
  "input": "const r = await tools.write_stdin({session_id:35523,chars:\"\",yield_time_ms:50000,max_output_tokens:300});\ntext(r.output);"
}
exec result
Script running with cell ID 45
Wall time 11.0 seconds
Output:
#69
reasoning (redacted)

encrypted chain-of-thought — recorded, not exposed

toolwait
args
{
  "cell_id": "45",
  "yield_time_ms": 50000,
  "max_tokens": 300
}
wait result
Script completed
Wall time 32.7 seconds
Output:
Warning: truncated output (original token count: 327)
Total output lines: 14

Warning: truncated output (original token count: 1767)
Total output lines: 58

vLLM generation done - elapsed time: 3.71s, prompts: 4, total tokens: 3387, avg length: 846.8, speed: 913.6 tok/s
vLLM generation done - elapsed time: 3.72s, prompts: 4, total tokens: 3681, avg length: 920.2, speed: 988.5 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 4086, avg length: 1021.5, speed: 1093.3 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 3842, avg length: 960.5, speed: 1027.6 tok/s
vLLM generation done - elapsed time: 3.69s, prompts: 4, to…27 tokens truncated…mpts: 4, total tokens: 4096, avg length: 1024.0, speed: 1092.2 tok/s
vLLM generation done - elapsed time: 3.70s, prompts: 4, total tokens: 3639, avg length: 909.8, speed: 983.3 tok/s
vLLM generation done - elapsed time: 3.72s, prompts: 4, total tokens: 3738, avg length: 934.5, speed: 1004.3 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 3626, avg length: 906.5, speed: 969.5 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 4017, avg length: 1004.2, speed: 1069.3 tok/s

 83%|████████▎ | 83/100 [12:20<02:31,  8.91s/it]
#70
reasoning (redacted)

encrypted chain-of-thought — recorded, not exposed

toolexec
args
{
  "input": "const r = await tools.write_stdin({session_id:35523,chars:\"\",yield_time_ms:50000,max_output_tokens:300});\ntext(r.output);"
}
exec result
Script running with cell ID 46
Wall time 11.0 seconds
Output:
#71
reasoning (redacted)

encrypted chain-of-thought — recorded, not exposed

toolwait
args
{
  "cell_id": "46",
  "yield_time_ms": 50000,
  "max_tokens": 300
}
wait result
Script completed
Wall time 24.7 seconds
Output:
Warning: truncated output (original token count: 327)
Total output lines: 13

Warning: truncated output (original token count: 4447)
Total output lines: 321

vLLM generation done - elapsed time: 3.69s, prompts: 4, total tokens: 3713, avg length: 928.2, speed: 1005.3 tok/s
vLLM generation done - elapsed time: 3.70s, prompts: 4, total tokens: 3221, avg length: 805.2, speed: 870.7 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1092.5 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1094.7 tok/s
vLLM generation done - elapsed time: 3.60s, prompts: 4,…27 tokens truncated…mpts: 4, total tokens: 4096, avg length: 1024.0, speed: 1089.4 tok/s

 89%|████████▉ | 89/100 [13:13<01:37,  8.89s/it]vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 3497, avg length: 874.2, speed: 937.9 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 3705, avg length: 926.2, speed: 990.5 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 3991, avg length: 997.8, speed: 1063.5 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1089.9 tok/s
#72
reasoning (redacted)

encrypted chain-of-thought — recorded, not exposed

toolexec
args
{
  "input": "const r = await tools.write_stdin({session_id:35523,chars:\"\",yield_time_ms:50000,max_output_tokens:500});\ntext(r.output);"
}
exec result
Script running with cell ID 47
Wall time 11.0 seconds
Output:
#73
reasoning (redacted)

encrypted chain-of-thought — recorded, not exposed

toolwait
args
{
  "cell_id": "47",
  "yield_time_ms": 50000,
  "max_tokens": 500
}
wait result
Script completed
Wall time 33.1 seconds
Output:
Warning: truncated output (original token count: 527)
Total output lines: 21

Warning: truncated output (original token count: 3123)
Total output lines: 238

vLLM generation done - elapsed time: 3.69s, prompts: 4, total tokens: 3446, avg length: 861.5, speed: 933.7 tok/s
vLLM generation done - elapsed time: 3.71s, prompts: 4, total tokens: 3392, avg length: 848.0, speed: 913.8 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1094.2 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1090.0 tok/s

 90%|█████████ | 90/100 [13:22<01:28,  8.88s/it]
                                                
{'loss': -0.0036, 'grad_norm': 0.06196518614888191, 'learning_rate': 5.5e-07, 'on_policy_loss': -0.0036, 'rollout_accuracy': 0.0, 'epoch': 0.33}

 90%|█████████ | 90/100 [13:22<01:28,  8.88s/it]vLLM generation done - elapsed time: 3.72s, prompts: 4, total tokens: 3493, avg length: 873.2, speed: 939.2 tok/s
vLLM genera…27 tokens truncated…speed: 998.0 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1094.7 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 3615, avg length: 903.8, speed: 965.7 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 3863, avg length: 965.8, speed: 1028.0 tok/s

================================================================================
Saved 40 generation outputs to:
  /workspace/runs/frontier_v1/capped_seed42/generations/generations_step_95.json
================================================================================


 96%|█████████▌| 96/100 [14:16<00:35,  8.90s/it]
                                                
{'loss': -0.004, 'grad_norm': 0.07352576404809952, 'learning_rate': 2.5000000000000004e-07, 'on_policy_loss': -0.004, 'rollout_accuracy': 0.125, 'epoch': 0.35}

 96%|█████████▌| 96/100 [14:16<00:35,  8.90s/it]
#74
reasoning (redacted)

encrypted chain-of-thought — recorded, not exposed

toolexec
args
{
  "input": "const r = await tools.write_stdin({session_id:35523,chars:\"\",yield_time_ms:50000,max_output_tokens:1200});\ntext(r.output);"
}
exec result
Script running with cell ID 48
Wall time 11.0 seconds
Output:
#75
reasoning (redacted)

encrypted chain-of-thought — recorded, not exposed

toolwait
args
{
  "cell_id": "48",
  "yield_time_ms": 50000,
  "max_tokens": 1200
}
wait result
Script completed
Wall time 26.9 seconds
Output:
Warning: truncated output (original token count: 1227)
Total output lines: 34

Warning: truncated output (original token count: 1513)
Total output lines: 41

vLLM generation done - elapsed time: 3.71s, prompts: 4, total tokens: 3984, avg length: 996.0, speed: 1073.0 tok/s
vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 3681, avg length: 920.2, speed: 986.1 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 3817, avg length: 954.2, speed: 1018.4 tok/s
vLLM generation done - elapsed time: 3.78s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1082.7 tok/s
vLLM generation done - elapsed time: 3.71s, prompts: 4, total tokens: 3087, avg length: 771.8, speed: 833.1 tok/s
vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 3358, avg length: 839.5, speed: 900.8 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1094.5 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1094.7 tok/s

 97%|█████████▋| 97/100 [14:24<00:26,  8.89s/it]vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 3621, avg length: 905.2, speed: 970.7 tok/s
vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 3459, avg length: 864.8, speed: 928.0 tok/s
vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1096.8 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 4091, avg length: 1022.8, speed: 1086.7 tok/s
vLLM generation done - elapsed time: 3.70s, prompts: 4, total tokens: 3238, avg length: 809.5, speed: 875.7 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 3685, avg length: 921.2, speed: 982.6 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1088.3 tok/s
vLLM generation done - elapsed time: 3.77s, prompts: 4, total tokens: 4079, avg length: 1019.8, speed: 1082.1 tok/s

 98%|█████████▊| 98/100 [14:33<00:17,  8.92s/it]
                                                
{'loss': -0.0033, 'grad_norm': 0.08722443878650665, 'learning_rate': 1.5000000000000002e-07, 'on_policy_loss': -0.0033, 'rollout_accuracy': 0.1875, 'epoch': 0.36}

 98%|█████████▊| 98/100 [14:34<00:17,  8.92s/it]vLLM generation done - elapsed time: 3.69s, …27 tokens truncated…ed time: 3.76s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1089.2 tok/s
vLLM generation done - elapsed time: 3.70s, prompts: 4, total tokens: 3238, avg length: 809.5, speed: 874.5 tok/s
vLLM generation done - elapsed time: 3.71s, prompts: 4, total tokens: 3836, avg length: 959.0, speed: 1033.8 tok/s
vLLM generation done - elapsed time: 3.72s, prompts: 4, total tokens: 3619, avg length: 904.8, speed: 972.2 tok/s
vLLM generation done - elapsed time: 3.77s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1087.8 tok/s

100%|██████████| 100/100 [14:51<00:00,  8.93s/it]
                                                 
{'loss': -0.0048, 'grad_norm': 0.06867505609989166, 'learning_rate': 5.0000000000000004e-08, 'on_policy_loss': -0.0048, 'rollout_accuracy': 0.1875, 'epoch': 0.36}

100%|██████████| 100/100 [14:52<00:00,  8.93s/it]
                                                 
{'train_runtime': 895.323, 'train_samples_per_second': 3.574, 'train_steps_per_second': 0.112, 'train_loss': 0.001322486400604248, 'epoch': 0.36}

100%|██████████| 100/100 [14:55<00:00,  8.93s/it]
100%|██████████| 100/100 [14:55<00:00,  8.95s/it]
[rank0]:[W803 05:01:34.463484419 ProcessGroupNCCL.cpp:1538] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
[rank3]:[W803 05:01:35.361362524 ProcessGroupNCCL.cpp:1538] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
[rank2]:[W803 05:01:35.372091764 ProcessGroupNCCL.cpp:1538] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
[rank1]:[W803 05:01:36.844714110 ProcessGroupNCCL.cpp:1538] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
TRAIN_CKPT=/workspace/runs/frontier_v1/capped_seed42/checkpoint-100