gpt-5.6-sol
on-policy-self-distillation — graded by the task's verifier against a measured baseline.
- backend
- modal
- variant
- codex azure_ai/gpt-5.6-sol
- metric
- AIME24 avg@12 accuracy
- actions
- 636
- duration
- 8h 10m
- recorded
- 2026-08-03
run idopsd-aime24-4gpus__3tyLi4e
Everything gpt-5.6-sol did on this task, in order.
download JSON ↗encrypted chain-of-thought — recorded, not exposed
args
{
"cell_id": "37",
"yield_time_ms": 50000,
"max_tokens": 500
}wait result
Script completed
Wall time 32.1 seconds
Output:
Warning: truncated output (original token count: 527)
Total output lines: 24
Warning: truncated output (original token count: 1921)
Total output lines: 67
vLLM generation done - elapsed time: 3.70s, prompts: 4, total tokens: 3602, avg length: 900.5, speed: 974.2 tok/s
vLLM generation done - elapsed time: 3.71s, prompts: 4, total tokens: 3649, avg length: 912.2, speed: 984.1 tok/s
vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 3695, avg length: 923.8, speed: 991.9 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 3952, avg length: 988.0, speed: 1055.5 tok/s
vLLM generation done - elapsed time: 3.66s, prompts: 4, total tokens: 3638, avg length: 909.5, speed: 994.6 tok/s
vLLM generation done - elapsed time: 3.71s, prompts: 4, total tokens: 3403, avg length: 850.8, speed: 916.2 tok/s
vLLM generation done - elapsed time: 3.72s, prompts: 4, total tokens: 3557, avg length: 889.2, speed: 956.8 tok/s
vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 3759, avg length: 939.8, speed: 1006.7 tok/s
…27 tokens truncated…time: 3.73s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1098.4 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 3785, avg length: 946.2, speed: 1012.3 tok/s
================================================================================
Saved 40 generation outputs to:
/workspace/runs/frontier_v1/capped_seed42/generations/generations_step_30.json
================================================================================
31%|███ | 31/100 [04:35<10:14, 8.90s/it]vLLM generation done - elapsed time: 3.62s, prompts: 4, total tokens: 3031, avg length: 757.8, speed: 837.6 tok/s
vLLM generation done - elapsed time: 3.66s, prompts: 4, total tokens: 3013, avg length: 753.2, speed: 823.2 tok/s
vLLM generation done - elapsed time: 3.69s, prompts: 4, total tokens: 3175, avg length: 793.8, speed: 860.4 tok/s
vLLM generation done - elapsed time: 3.72s, prompts: 4, total tokens: 3651, avg length: 912.8, speed: 982.2 tok/s
At roughly one-third of training, rollout accuracy continues to fluctuate around the expected frontier (roughly 20–60% per small logging window), while gradient norms have already fallen below the 0.1 cap in most windows. That indicates the correctness term is not overwhelming the KL objective; I’ll use the full evaluation, not these noisy training statistics, to decide whether the curriculum is too narrow.
encrypted chain-of-thought — recorded, not exposed
args
{
"input": "const r = await tools.write_stdin({session_id:35523,chars:\"\",yield_time_ms:50000,max_output_tokens:450});\ntext(r.output);"
}exec result
Script running with cell ID 38
Wall time 11.0 seconds
Output:
encrypted chain-of-thought — recorded, not exposed
args
{
"cell_id": "38",
"yield_time_ms": 50000,
"max_tokens": 450
}wait result
Script completed
Wall time 30.8 seconds
Output:
Warning: truncated output (original token count: 477)
Total output lines: 16
Warning: truncated output (original token count: 1938)
Total output lines: 63
vLLM generation done - elapsed time: 3.65s, prompts: 4, total tokens: 2847, avg length: 711.8, speed: 779.6 tok/s
vLLM generation done - elapsed time: 3.69s, prompts: 4, total tokens: 3310, avg length: 827.5, speed: 897.3 tok/s
vLLM generation done - elapsed time: 3.69s, prompts: 4, total tokens: 3696, avg length: 924.0, speed: 1000.4 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1092.8 tok/s
32%|███▏ | 32/100 [04:44<10:03, 8.88s/it]
{'loss': 0.0013, 'grad_norm': 0.06294427067041397, 'learning_rate': 3.45e-06, 'on_policy_loss': 0.0013, 'rollout_accuracy': 0.125, 'epoch': 0.12}
32%|███▏ | 32/100 [04:44<10:03, 8.88s/it]vLLM generation done - elapsed time: 3.77s, pro…27 tokens truncated…generation done - elapsed time: 3.76s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1088.0 tok/s
vLLM generation done - elapsed time: 3.68s, prompts: 4, total tokens: 3066, avg length: 766.5, speed: 832.8 tok/s
vLLM generation done - elapsed time: 3.71s, prompts: 4, total tokens: 3524, avg length: 881.0, speed: 949.9 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 3800, avg length: 950.0, speed: 1017.3 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 3970, avg length: 992.5, speed: 1057.1 tok/s
38%|███▊ | 38/100 [05:38<09:15, 8.96s/it]
{'loss': -0.0004, 'grad_norm': 0.04886931553483009, 'learning_rate': 3.1500000000000003e-06, 'on_policy_loss': -0.0004, 'rollout_accuracy': 0.25, 'epoch': 0.14}
38%|███▊ | 38/100 [05:38<09:15, 8.96s/it]encrypted chain-of-thought — recorded, not exposed
args
{
"input": "const r = await tools.write_stdin({session_id:35523,chars:\"\",yield_time_ms:50000,max_output_tokens:400});\ntext(r.output);"
}exec result
Script running with cell ID 39
Wall time 11.0 seconds
Output:
encrypted chain-of-thought — recorded, not exposed
args
{
"cell_id": "39",
"yield_time_ms": 50000,
"max_tokens": 400
}wait result
Script completed
Wall time 31.7 seconds
Output:
Warning: truncated output (original token count: 427)
Total output lines: 15
Warning: truncated output (original token count: 1859)
Total output lines: 61
vLLM generation done - elapsed time: 3.69s, prompts: 4, total tokens: 3298, avg length: 824.5, speed: 893.1 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 3780, avg length: 945.0, speed: 1011.6 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 3821, avg length: 955.2, speed: 1020.1 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1088.2 tok/s
vLLM generation done - elapsed time: 3.68s, prompts: 4, total tokens: 3065, avg length: 766.2, speed: 832.2 tok/s
vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 3636, avg length: 909.0, speed: 975.0 tok/s
vLLM generation done - elap…27 tokens truncated…ed: 1087.1 tok/s
44%|████▍ | 44/100 [06:32<08:18, 8.91s/it]
{'loss': 0.0011, 'grad_norm': 0.09780632704496384, 'learning_rate': 2.85e-06, 'on_policy_loss': 0.0011, 'rollout_accuracy': 0.4375, 'epoch': 0.16}
44%|████▍ | 44/100 [06:32<08:18, 8.91s/it]vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 3635, avg length: 908.8, speed: 970.0 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1091.0 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1088.4 tok/s
vLLM generation done - elapsed time: 3.77s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1085.1 tok/s
encrypted chain-of-thought — recorded, not exposed
args
{
"input": "const r = await tools.write_stdin({session_id:35523,chars:\"\",yield_time_ms:50000,max_output_tokens:400});\ntext(r.output);"
}exec result
Script running with cell ID 40
Wall time 11.0 seconds
Output:
encrypted chain-of-thought — recorded, not exposed
args
{
"cell_id": "40",
"yield_time_ms": 50000,
"max_tokens": 400
}wait result
Script completed
Wall time 29.2 seconds
Output:
Warning: truncated output (original token count: 427)
Total output lines: 20
Warning: truncated output (original token count: 1948)
Total output lines: 68
vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 3828, avg length: 957.0, speed: 1026.9 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 3714, avg length: 928.5, speed: 993.4 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 4006, avg length: 1001.5, speed: 1068.6 tok/s
vLLM generation done - elapsed time: 3.77s, prompts: 4, total tokens: 4080, avg length: 1020.0, speed: 1082.6 tok/s
45%|████▌ | 45/100 [06:41<08:09, 8.90s/it]vLLM generation done - elapsed time: 3.60s, prompts: 4, total tokens: 3045, avg length: 761.2, speed: 845.1 tok/s
vLLM generation done - elapsed time: 3.70s, prompts: 4, total tokens: 3364, avg le…27 tokens truncated… generation done - elapsed time: 3.77s, prompts: 4, total tokens: 3618, avg length: 904.5, speed: 960.6 tok/s
vLLM generation done - elapsed time: 3.77s, prompts: 4, total tokens: 3500, avg length: 875.0, speed: 928.2 tok/s
vLLM generation done - elapsed time: 3.78s, prompts: 4, total tokens: 3974, avg length: 993.5, speed: 1050.2 tok/s
vLLM generation done - elapsed time: 3.79s, prompts: 4, total tokens: 3901, avg length: 975.2, speed: 1029.8 tok/s
================================================================================
Saved 40 generation outputs to:
/workspace/runs/frontier_v1/capped_seed42/generations/generations_step_50.json
================================================================================
51%|█████ | 51/100 [07:34<07:19, 8.97s/it]encrypted chain-of-thought — recorded, not exposed
args
{
"input": "const r = await tools.write_stdin({session_id:35523,chars:\"\",yield_time_ms:50000,max_output_tokens:350});\ntext(r.output);"
}exec result
Script running with cell ID 41
Wall time 11.0 seconds
Output:
encrypted chain-of-thought — recorded, not exposed
args
{
"cell_id": "41",
"yield_time_ms": 50000,
"max_tokens": 350
}wait result
Script completed
Wall time 30.6 seconds
Output:
Warning: truncated output (original token count: 377)
Total output lines: 15
Warning: truncated output (original token count: 3068)
Total output lines: 189
vLLM generation done - elapsed time: 3.77s, prompts: 4, total tokens: 3348, avg length: 837.0, speed: 887.5 tok/s
vLLM generation done - elapsed time: 3.79s, prompts: 4, total tokens: 3888, avg length: 972.0, speed: 1026.4 tok/s
vLLM generation done - elapsed time: 3.82s, prompts: 4, total tokens: 3927, avg length: 981.8, speed: 1029.2 tok/s
vLLM generation done - elapsed time: 3.82s, prompts: 4, total tokens: 3975, avg length: 993.8, speed: 1040.8 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 3374, avg length: 843.5, speed: 900.0 tok/s
vLLM generation done - elapsed time: 3.77s…27 tokens truncated…al tokens: 4096, avg length: 1024.0, speed: 1086.2 tok/s
vLLM generation done - elapsed time: 3.79s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1080.6 tok/s
57%|█████▋ | 57/100 [08:28<06:25, 8.96s/it]vLLM generation done - elapsed time: 3.72s, prompts: 4, total tokens: 3350, avg length: 837.5, speed: 901.7 tok/s
vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 3678, avg length: 919.5, speed: 986.8 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 4032, avg length: 1008.0, speed: 1071.0 tok/s
vLLM generation done - elapsed time: 3.78s, prompts: 4, total tokens: 4049, avg length: 1012.2, speed: 1071.2 tok/s
encrypted chain-of-thought — recorded, not exposed
args
{
"input": "const r = await tools.write_stdin({session_id:35523,chars:\"\",yield_time_ms:50000,max_output_tokens:350});\ntext(r.output);"
}exec result
Script running with cell ID 42
Wall time 11.0 seconds
Output:
encrypted chain-of-thought — recorded, not exposed
args
{
"cell_id": "42",
"yield_time_ms": 50000,
"max_tokens": 350
}wait result
Script completed
Wall time 31.9 seconds
Output:
Warning: truncated output (original token count: 377)
Total output lines: 13
Warning: truncated output (original token count: 1950)
Total output lines: 63
vLLM generation done - elapsed time: 3.72s, prompts: 4, total tokens: 3380, avg length: 845.0, speed: 907.8 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 4053, avg length: 1013.2, speed: 1082.1 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 3746, avg length: 936.5, speed: 997.5 tok/s
vLLM generation done - elapsed time: 3.77s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1086.7 tok/s
58%|█████▊ | 58/100 [08:37<06:15, 8.95s/it]
{'loss': -0.0009, 'grad_norm': 0.0543122440576…27 tokens truncated…14.2, speed: 691.3 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 3968, avg length: 992.0, speed: 1061.6 tok/s
vLLM generation done - elapsed time: 3.77s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1085.4 tok/s
vLLM generation done - elapsed time: 3.77s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1085.1 tok/s
64%|██████▍ | 64/100 [09:31<05:22, 8.95s/it]
{'loss': -0.0019, 'grad_norm': 0.06151019409298897, 'learning_rate': 1.85e-06, 'on_policy_loss': -0.0019, 'rollout_accuracy': 0.25, 'epoch': 0.23}
64%|██████▍ | 64/100 [09:31<05:22, 8.95s/it]The run is now past step 60 and remains numerically stable. As expected from the paper’s one-sided vocabulary clipping, the aggregate clipped objective has crossed slightly below zero late in training; gradients remain finite and modest. The checkpoint should be ready in about six minutes, after which I’ll run the full 30×12 evaluation.
encrypted chain-of-thought — recorded, not exposed
args
{
"input": "const r = await tools.write_stdin({session_id:35523,chars:\"\",yield_time_ms:50000,max_output_tokens:300});\ntext(r.output);"
}exec result
Script running with cell ID 43
Wall time 11.0 seconds
Output:
encrypted chain-of-thought — recorded, not exposed
args
{
"cell_id": "43",
"yield_time_ms": 50000,
"max_tokens": 300
}wait result
Script completed
Wall time 35.5 seconds
Output:
Warning: truncated output (original token count: 327)
Total output lines: 13
Warning: truncated output (original token count: 1758)
Total output lines: 58
vLLM generation done - elapsed time: 3.65s, prompts: 4, total tokens: 2849, avg length: 712.2, speed: 779.7 tok/s
vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 3658, avg length: 914.5, speed: 979.5 tok/s
vLLM generation done - elapsed time: 3.77s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1085.5 tok/s
vLLM generation done - elapsed time: 3.78s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1083.5 tok/s
vLLM generation done - elapsed time: 3.71s, prompts: 4, t…27 tokens truncated… 896.0, speed: 959.2 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 3595, avg length: 898.8, speed: 961.5 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 4015, avg length: 1003.8, speed: 1072.8 tok/s
70%|███████ | 70/100 [10:24<04:26, 8.88s/it]
{'loss': -0.0024, 'grad_norm': 0.07535967230796814, 'learning_rate': 1.5500000000000002e-06, 'on_policy_loss': -0.0024, 'rollout_accuracy': 0.3125, 'epoch': 0.25}
70%|███████ | 70/100 [10:24<04:26, 8.88s/it]encrypted chain-of-thought — recorded, not exposed
args
{
"input": "const r = await tools.write_stdin({session_id:35523,chars:\"\",yield_time_ms:50000,max_output_tokens:300});\ntext(r.output);"
}exec result
Script running with cell ID 44
Wall time 11.0 seconds
Output:
encrypted chain-of-thought — recorded, not exposed
args
{
"cell_id": "44",
"yield_time_ms": 50000,
"max_tokens": 300
}wait result
Script completed
Wall time 36.2 seconds
Output:
Warning: truncated output (original token count: 327)
Total output lines: 14
Warning: truncated output (original token count: 2079)
Total output lines: 72
vLLM generation done - elapsed time: 3.70s, prompts: 4, total tokens: 3468, avg length: 867.0, speed: 937.8 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 3836, avg length: 959.0, speed: 1022.7 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 3811, avg length: 952.8, speed: 1015.7 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 3979, avg length: 994.8, speed: 1058.9 tok/s
vLLM generation done - elapsed time: 3.67s, prompts: 4, to…27 tokens truncated…prompts: 4, total tokens: 4065, avg length: 1016.2, speed: 1083.2 tok/s
vLLM generation done - elapsed time: 3.62s, prompts: 4, total tokens: 2760, avg length: 690.0, speed: 762.1 tok/s
vLLM generation done - elapsed time: 3.70s, prompts: 4, total tokens: 3335, avg length: 833.8, speed: 900.7 tok/s
vLLM generation done - elapsed time: 3.71s, prompts: 4, total tokens: 3385, avg length: 846.2, speed: 911.6 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1093.3 tok/s
77%|███████▋ | 77/100 [11:27<03:24, 8.87s/it]encrypted chain-of-thought — recorded, not exposed
args
{
"input": "const r = await tools.write_stdin({session_id:35523,chars:\"\",yield_time_ms:50000,max_output_tokens:300});\ntext(r.output);"
}exec result
Script running with cell ID 45
Wall time 11.0 seconds
Output:
encrypted chain-of-thought — recorded, not exposed
args
{
"cell_id": "45",
"yield_time_ms": 50000,
"max_tokens": 300
}wait result
Script completed
Wall time 32.7 seconds
Output:
Warning: truncated output (original token count: 327)
Total output lines: 14
Warning: truncated output (original token count: 1767)
Total output lines: 58
vLLM generation done - elapsed time: 3.71s, prompts: 4, total tokens: 3387, avg length: 846.8, speed: 913.6 tok/s
vLLM generation done - elapsed time: 3.72s, prompts: 4, total tokens: 3681, avg length: 920.2, speed: 988.5 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 4086, avg length: 1021.5, speed: 1093.3 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 3842, avg length: 960.5, speed: 1027.6 tok/s
vLLM generation done - elapsed time: 3.69s, prompts: 4, to…27 tokens truncated…mpts: 4, total tokens: 4096, avg length: 1024.0, speed: 1092.2 tok/s
vLLM generation done - elapsed time: 3.70s, prompts: 4, total tokens: 3639, avg length: 909.8, speed: 983.3 tok/s
vLLM generation done - elapsed time: 3.72s, prompts: 4, total tokens: 3738, avg length: 934.5, speed: 1004.3 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 3626, avg length: 906.5, speed: 969.5 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 4017, avg length: 1004.2, speed: 1069.3 tok/s
83%|████████▎ | 83/100 [12:20<02:31, 8.91s/it]encrypted chain-of-thought — recorded, not exposed
args
{
"input": "const r = await tools.write_stdin({session_id:35523,chars:\"\",yield_time_ms:50000,max_output_tokens:300});\ntext(r.output);"
}exec result
Script running with cell ID 46
Wall time 11.0 seconds
Output:
encrypted chain-of-thought — recorded, not exposed
args
{
"cell_id": "46",
"yield_time_ms": 50000,
"max_tokens": 300
}wait result
Script completed
Wall time 24.7 seconds
Output:
Warning: truncated output (original token count: 327)
Total output lines: 13
Warning: truncated output (original token count: 4447)
Total output lines: 321
vLLM generation done - elapsed time: 3.69s, prompts: 4, total tokens: 3713, avg length: 928.2, speed: 1005.3 tok/s
vLLM generation done - elapsed time: 3.70s, prompts: 4, total tokens: 3221, avg length: 805.2, speed: 870.7 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1092.5 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1094.7 tok/s
vLLM generation done - elapsed time: 3.60s, prompts: 4,…27 tokens truncated…mpts: 4, total tokens: 4096, avg length: 1024.0, speed: 1089.4 tok/s
89%|████████▉ | 89/100 [13:13<01:37, 8.89s/it]vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 3497, avg length: 874.2, speed: 937.9 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 3705, avg length: 926.2, speed: 990.5 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 3991, avg length: 997.8, speed: 1063.5 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1089.9 tok/s
encrypted chain-of-thought — recorded, not exposed
args
{
"input": "const r = await tools.write_stdin({session_id:35523,chars:\"\",yield_time_ms:50000,max_output_tokens:500});\ntext(r.output);"
}exec result
Script running with cell ID 47
Wall time 11.0 seconds
Output:
encrypted chain-of-thought — recorded, not exposed
args
{
"cell_id": "47",
"yield_time_ms": 50000,
"max_tokens": 500
}wait result
Script completed
Wall time 33.1 seconds
Output:
Warning: truncated output (original token count: 527)
Total output lines: 21
Warning: truncated output (original token count: 3123)
Total output lines: 238
vLLM generation done - elapsed time: 3.69s, prompts: 4, total tokens: 3446, avg length: 861.5, speed: 933.7 tok/s
vLLM generation done - elapsed time: 3.71s, prompts: 4, total tokens: 3392, avg length: 848.0, speed: 913.8 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1094.2 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1090.0 tok/s
90%|█████████ | 90/100 [13:22<01:28, 8.88s/it]
{'loss': -0.0036, 'grad_norm': 0.06196518614888191, 'learning_rate': 5.5e-07, 'on_policy_loss': -0.0036, 'rollout_accuracy': 0.0, 'epoch': 0.33}
90%|█████████ | 90/100 [13:22<01:28, 8.88s/it]vLLM generation done - elapsed time: 3.72s, prompts: 4, total tokens: 3493, avg length: 873.2, speed: 939.2 tok/s
vLLM genera…27 tokens truncated…speed: 998.0 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1094.7 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 3615, avg length: 903.8, speed: 965.7 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 3863, avg length: 965.8, speed: 1028.0 tok/s
================================================================================
Saved 40 generation outputs to:
/workspace/runs/frontier_v1/capped_seed42/generations/generations_step_95.json
================================================================================
96%|█████████▌| 96/100 [14:16<00:35, 8.90s/it]
{'loss': -0.004, 'grad_norm': 0.07352576404809952, 'learning_rate': 2.5000000000000004e-07, 'on_policy_loss': -0.004, 'rollout_accuracy': 0.125, 'epoch': 0.35}
96%|█████████▌| 96/100 [14:16<00:35, 8.90s/it]encrypted chain-of-thought — recorded, not exposed
args
{
"input": "const r = await tools.write_stdin({session_id:35523,chars:\"\",yield_time_ms:50000,max_output_tokens:1200});\ntext(r.output);"
}exec result
Script running with cell ID 48
Wall time 11.0 seconds
Output:
encrypted chain-of-thought — recorded, not exposed
args
{
"cell_id": "48",
"yield_time_ms": 50000,
"max_tokens": 1200
}wait result
Script completed
Wall time 26.9 seconds
Output:
Warning: truncated output (original token count: 1227)
Total output lines: 34
Warning: truncated output (original token count: 1513)
Total output lines: 41
vLLM generation done - elapsed time: 3.71s, prompts: 4, total tokens: 3984, avg length: 996.0, speed: 1073.0 tok/s
vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 3681, avg length: 920.2, speed: 986.1 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 3817, avg length: 954.2, speed: 1018.4 tok/s
vLLM generation done - elapsed time: 3.78s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1082.7 tok/s
vLLM generation done - elapsed time: 3.71s, prompts: 4, total tokens: 3087, avg length: 771.8, speed: 833.1 tok/s
vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 3358, avg length: 839.5, speed: 900.8 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1094.5 tok/s
vLLM generation done - elapsed time: 3.74s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1094.7 tok/s
97%|█████████▋| 97/100 [14:24<00:26, 8.89s/it]vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 3621, avg length: 905.2, speed: 970.7 tok/s
vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 3459, avg length: 864.8, speed: 928.0 tok/s
vLLM generation done - elapsed time: 3.73s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1096.8 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 4091, avg length: 1022.8, speed: 1086.7 tok/s
vLLM generation done - elapsed time: 3.70s, prompts: 4, total tokens: 3238, avg length: 809.5, speed: 875.7 tok/s
vLLM generation done - elapsed time: 3.75s, prompts: 4, total tokens: 3685, avg length: 921.2, speed: 982.6 tok/s
vLLM generation done - elapsed time: 3.76s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1088.3 tok/s
vLLM generation done - elapsed time: 3.77s, prompts: 4, total tokens: 4079, avg length: 1019.8, speed: 1082.1 tok/s
98%|█████████▊| 98/100 [14:33<00:17, 8.92s/it]
{'loss': -0.0033, 'grad_norm': 0.08722443878650665, 'learning_rate': 1.5000000000000002e-07, 'on_policy_loss': -0.0033, 'rollout_accuracy': 0.1875, 'epoch': 0.36}
98%|█████████▊| 98/100 [14:34<00:17, 8.92s/it]vLLM generation done - elapsed time: 3.69s, …27 tokens truncated…ed time: 3.76s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1089.2 tok/s
vLLM generation done - elapsed time: 3.70s, prompts: 4, total tokens: 3238, avg length: 809.5, speed: 874.5 tok/s
vLLM generation done - elapsed time: 3.71s, prompts: 4, total tokens: 3836, avg length: 959.0, speed: 1033.8 tok/s
vLLM generation done - elapsed time: 3.72s, prompts: 4, total tokens: 3619, avg length: 904.8, speed: 972.2 tok/s
vLLM generation done - elapsed time: 3.77s, prompts: 4, total tokens: 4096, avg length: 1024.0, speed: 1087.8 tok/s
100%|██████████| 100/100 [14:51<00:00, 8.93s/it]
{'loss': -0.0048, 'grad_norm': 0.06867505609989166, 'learning_rate': 5.0000000000000004e-08, 'on_policy_loss': -0.0048, 'rollout_accuracy': 0.1875, 'epoch': 0.36}
100%|██████████| 100/100 [14:52<00:00, 8.93s/it]
{'train_runtime': 895.323, 'train_samples_per_second': 3.574, 'train_steps_per_second': 0.112, 'train_loss': 0.001322486400604248, 'epoch': 0.36}
100%|██████████| 100/100 [14:55<00:00, 8.93s/it]
100%|██████████| 100/100 [14:55<00:00, 8.95s/it]
[rank0]:[W803 05:01:34.463484419 ProcessGroupNCCL.cpp:1538] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
[rank3]:[W803 05:01:35.361362524 ProcessGroupNCCL.cpp:1538] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
[rank2]:[W803 05:01:35.372091764 ProcessGroupNCCL.cpp:1538] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
[rank1]:[W803 05:01:36.844714110 ProcessGroupNCCL.cpp:1538] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
TRAIN_CKPT=/workspace/runs/frontier_v1/capped_seed42/checkpoint-100