{
  "metadata": {
    "python": "3.12.3",
    "platform": "Linux-6.8.0-62-generic-x86_64-with-glibc2.39",
    "torch": "2.8.0+cu128",
    "cuda_available": true,
    "gpu_name": "NVIDIA RTX 6000 Ada Generation",
    "args": {
      "run_name": "main_progressive_repair_s512",
      "compiler_checkpoint": "large_artifacts/qwen_progressive_repair_compiler/checkpoints/fixed_compiler_step00800",
      "train_examples": 512,
      "val_examples": 128,
      "eval_examples": 256,
      "eval_pairs": 256,
      "train_length": 24,
      "eval_length": 24,
      "train_template_modes": "standard,paraphrase",
      "repair_topk": 3,
      "repair_max_edits": 2,
      "repair_max_pair_arg_slots": 24,
      "candidate_curriculum": "small:2:1:8:3,medium:3:1:16:4,full:3:2:24:11",
      "qwen_batch_size": 8,
      "max_length": 384,
      "trace_d_model": 128,
      "trace_layers": 3,
      "trace_heads": 4,
      "trace_ff_mult": 4,
      "verifier_dropout": 0.05,
      "verifier_epochs": 18,
      "verifier_lr": 0.001,
      "verifier_weight_decay": 0.0001,
      "no_positive_base_weight": 0.2,
      "grad_clip": 1.0,
      "pair_top_m": 25,
      "pair_bonus": 2.0,
      "seed": 17,
      "eval_seed": 94001
    },
    "compiler_args": {
      "model_id": "Qwen/Qwen3-4B",
      "modulus": 97,
      "max_steps": 24,
      "head_width": 768,
      "rank_temperature": 1.0,
      "arg_reader_mode": "after_op",
      "arg_window": 8,
      "arg_distance_temperature": 2.0
    },
    "feature_names": [
      "bias",
      "candidate_prior",
      "prior_delta",
      "candidate_prior_per_slot",
      "prior_delta_per_edit",
      "base_prior",
      "edit_count",
      "changed",
      "init_edit",
      "op_edit_count",
      "arg_edit_count",
      "edit_fraction",
      "first_edit_pos_norm",
      "last_edit_pos_norm",
      "mean_edit_pos_norm",
      "edit_span_norm",
      "mean_new_rank",
      "max_new_rank",
      "mean_changed_margin",
      "min_changed_margin",
      "mean_changed_entropy",
      "mean_logp_delta",
      "min_logp_delta",
      "max_logp_delta",
      "base_init_margin",
      "base_op_margin_mean",
      "base_op_margin_min",
      "base_arg_margin_mean",
      "base_arg_margin_min",
      "base_op_entropy_mean",
      "base_arg_entropy_mean",
      "candidate_answer_norm",
      "candidate_final_soft_logp",
      "candidate_state_soft_logp_mean",
      "candidate_state_soft_logp_min",
      "base_final_soft_logp",
      "base_state_soft_logp_mean",
      "answer_equals_base",
      "state_same_fraction_as_base",
      "state_prefix_same_as_base",
      "mean_old_value_norm",
      "mean_new_value_norm",
      "mean_abs_value_delta_norm",
      "arg_new_value_mean_norm",
      "arg_abs_delta_mean_norm",
      "op_new_add_frac",
      "op_new_sub_frac",
      "op_new_mul_frac",
      "candidate_add_frac",
      "candidate_sub_frac",
      "candidate_mul_frac",
      "candidate_arg_mean_norm",
      "candidate_arg_std_norm",
      "base_add_frac",
      "base_sub_frac",
      "base_mul_frac"
    ],
    "trace_feature_names": [
      "is_global",
      "is_step",
      "active",
      "step_pos_norm",
      "candidate_prior",
      "prior_delta",
      "edit_count",
      "init_value_norm",
      "init_changed",
      "answer_norm",
      "final_soft_logp",
      "base_final_soft_logp",
      "answer_equals_base",
      "op_add",
      "op_sub",
      "op_mul",
      "arg_norm",
      "state_norm",
      "state_soft_logp",
      "base_op_add",
      "base_op_sub",
      "base_op_mul",
      "base_arg_norm",
      "base_state_norm",
      "base_state_soft_logp",
      "op_changed",
      "arg_changed",
      "state_same_as_base",
      "op_logp",
      "arg_logp",
      "op_logp_delta",
      "arg_logp_delta",
      "op_margin",
      "arg_margin",
      "op_entropy",
      "arg_entropy"
    ],
    "candidate_curriculum_stages": [
      {
        "name": "small",
        "topk": 2,
        "max_edits": 1,
        "max_pair_arg_slots": 8,
        "epochs": 3
      },
      {
        "name": "medium",
        "topk": 3,
        "max_edits": 1,
        "max_pair_arg_slots": 16,
        "epochs": 4
      },
      {
        "name": "full",
        "topk": 3,
        "max_edits": 2,
        "max_pair_arg_slots": 24,
        "epochs": 11
      }
    ],
    "train_seconds": 874.9219071865082
  },
  "metrics": {
    "train_len24": {
      "n": 512.0,
      "oracle_found_fraction": 0.8671875,
      "avg_candidates": 1299.0,
      "avg_positive_candidates": 1.3671875,
      "base_executor_accuracy": 0.287109375,
      "base_program_exact": 0.287109375,
      "base_state_prefix_fraction": 0.5469563802083333,
      "base_changed_fraction": 0.0,
      "base_avg_edits": 0.0,
      "prior_executor_accuracy": 0.287109375,
      "prior_program_exact": 0.287109375,
      "prior_state_prefix_fraction": 0.5469563802083333,
      "prior_changed_fraction": 0.0,
      "prior_avg_edits": 0.0,
      "soft_trace_executor_accuracy": 0.0,
      "soft_trace_program_exact": 0.0,
      "soft_trace_state_prefix_fraction": 0.2115885416666667,
      "soft_trace_changed_fraction": 0.998046875,
      "soft_trace_avg_edits": 1.671875,
      "oracle_executor_accuracy": 0.8671875,
      "oracle_program_exact": 0.86328125,
      "oracle_state_prefix_fraction": 0.8968912760416666,
      "oracle_changed_fraction": 0.580078125,
      "oracle_avg_edits": 0.830078125,
      "learned_executor_accuracy": 0.513671875,
      "learned_program_exact": 0.513671875,
      "learned_state_prefix_fraction": 0.7347005208333337,
      "learned_changed_fraction": 0.548828125,
      "learned_avg_edits": 0.626953125,
      "learned_oracle_gap_recovered": 0.39057239057239057
    },
    "val_len24": {
      "n": 128.0,
      "oracle_found_fraction": 0.8515625,
      "avg_candidates": 1299.0,
      "avg_positive_candidates": 1.296875,
      "base_executor_accuracy": 0.3203125,
      "base_program_exact": 0.3203125,
      "base_state_prefix_fraction": 0.5787760416666666,
      "base_changed_fraction": 0.0,
      "base_avg_edits": 0.0,
      "prior_executor_accuracy": 0.3203125,
      "prior_program_exact": 0.3203125,
      "prior_state_prefix_fraction": 0.5787760416666666,
      "prior_changed_fraction": 0.0,
      "prior_avg_edits": 0.0,
      "soft_trace_executor_accuracy": 0.0,
      "soft_trace_program_exact": 0.0,
      "soft_trace_state_prefix_fraction": 0.2125651041666666,
      "soft_trace_changed_fraction": 1.0,
      "soft_trace_avg_edits": 1.671875,
      "oracle_executor_accuracy": 0.8515625,
      "oracle_program_exact": 0.84375,
      "oracle_state_prefix_fraction": 0.8798828125,
      "oracle_changed_fraction": 0.53125,
      "oracle_avg_edits": 0.7109375,
      "learned_executor_accuracy": 0.53125,
      "learned_program_exact": 0.53125,
      "learned_state_prefix_fraction": 0.7389322916666667,
      "learned_changed_fraction": 0.515625,
      "learned_avg_edits": 0.59375,
      "learned_oracle_gap_recovered": 0.39705882352941174
    },
    "fresh_standard_len24": {
      "n": 256.0,
      "oracle_found_fraction": 0.90625,
      "avg_candidates": 1299.0,
      "avg_positive_candidates": 1.35546875,
      "base_executor_accuracy": 0.28515625,
      "base_program_exact": 0.28125,
      "base_state_prefix_fraction": 0.5623372395833333,
      "base_changed_fraction": 0.0,
      "base_avg_edits": 0.0,
      "prior_executor_accuracy": 0.28515625,
      "prior_program_exact": 0.28125,
      "prior_state_prefix_fraction": 0.5623372395833333,
      "prior_changed_fraction": 0.0,
      "prior_avg_edits": 0.0,
      "soft_trace_executor_accuracy": 0.0,
      "soft_trace_program_exact": 0.0,
      "soft_trace_state_prefix_fraction": 0.20654296875000003,
      "soft_trace_changed_fraction": 1.0,
      "soft_trace_avg_edits": 1.6640625,
      "oracle_executor_accuracy": 0.90625,
      "oracle_program_exact": 0.90234375,
      "oracle_state_prefix_fraction": 0.9264322916666666,
      "oracle_changed_fraction": 0.62109375,
      "oracle_avg_edits": 0.88671875,
      "learned_executor_accuracy": 0.4765625,
      "learned_program_exact": 0.4765625,
      "learned_state_prefix_fraction": 0.7084960937500002,
      "learned_changed_fraction": 0.5390625,
      "learned_avg_edits": 0.6015625,
      "learned_oracle_gap_recovered": 0.3081761006289308
    },
    "fresh_paraphrase_len24": {
      "n": 256.0,
      "oracle_found_fraction": 0.8671875,
      "avg_candidates": 1299.0,
      "avg_positive_candidates": 1.20703125,
      "base_executor_accuracy": 0.28515625,
      "base_program_exact": 0.28515625,
      "base_state_prefix_fraction": 0.5485026041666669,
      "base_changed_fraction": 0.0,
      "base_avg_edits": 0.0,
      "prior_executor_accuracy": 0.28515625,
      "prior_program_exact": 0.28515625,
      "prior_state_prefix_fraction": 0.5485026041666669,
      "prior_changed_fraction": 0.0,
      "prior_avg_edits": 0.0,
      "soft_trace_executor_accuracy": 0.0,
      "soft_trace_program_exact": 0.0,
      "soft_trace_state_prefix_fraction": 0.20475260416666663,
      "soft_trace_changed_fraction": 0.99609375,
      "soft_trace_avg_edits": 1.6953125,
      "oracle_executor_accuracy": 0.8671875,
      "oracle_program_exact": 0.859375,
      "oracle_state_prefix_fraction": 0.8963216145833334,
      "oracle_changed_fraction": 0.58203125,
      "oracle_avg_edits": 0.8125,
      "learned_executor_accuracy": 0.44921875,
      "learned_program_exact": 0.44921875,
      "learned_state_prefix_fraction": 0.6764322916666664,
      "learned_changed_fraction": 0.56640625,
      "learned_avg_edits": 0.625,
      "learned_oracle_gap_recovered": 0.28187919463087246
    },
    "fresh_paired_len24": {
      "n": 512.0,
      "oracle_found_fraction": 0.880859375,
      "avg_candidates": 1299.0,
      "avg_positive_candidates": 1.52734375,
      "base_executor_accuracy": 0.302734375,
      "base_program_exact": 0.302734375,
      "base_state_prefix_fraction": 0.5860188802083333,
      "base_changed_fraction": 0.0,
      "base_avg_edits": 0.0,
      "prior_executor_accuracy": 0.302734375,
      "prior_program_exact": 0.302734375,
      "prior_state_prefix_fraction": 0.5860188802083333,
      "prior_changed_fraction": 0.0,
      "prior_avg_edits": 0.0,
      "soft_trace_executor_accuracy": 0.0,
      "soft_trace_program_exact": 0.0,
      "soft_trace_state_prefix_fraction": 0.21191406250000014,
      "soft_trace_changed_fraction": 1.0,
      "soft_trace_avg_edits": 1.669921875,
      "oracle_executor_accuracy": 0.880859375,
      "oracle_program_exact": 0.876953125,
      "oracle_state_prefix_fraction": 0.907470703125,
      "oracle_changed_fraction": 0.578125,
      "oracle_avg_edits": 0.7890625,
      "learned_executor_accuracy": 0.486328125,
      "learned_program_exact": 0.486328125,
      "learned_state_prefix_fraction": 0.71875,
      "learned_changed_fraction": 0.564453125,
      "learned_avg_edits": 0.62109375,
      "learned_oracle_gap_recovered": 0.31756756756756754,
      "pair_rerank_executor_accuracy": 0.537109375,
      "pair_rerank_program_exact": 0.537109375,
      "pair_rerank_state_prefix_fraction": 0.7618001302083336,
      "pair_rerank_changed_fraction": 0.560546875,
      "pair_rerank_avg_edits": 0.640625,
      "learned_pair_answer_consistency": 0.5703125,
      "learned_pair_both_correct": 0.3671875,
      "learned_pair_program_consistency": 0.5703125,
      "learned_pair_state_consistency": 0.5703125,
      "pair_rerank_pair_answer_consistency": 0.87890625,
      "pair_rerank_pair_both_correct": 0.50390625,
      "pair_rerank_pair_program_consistency": 0.875,
      "pair_rerank_pair_state_consistency": 0.875,
      "oracle_pair_answer_consistency": 0.92578125,
      "oracle_pair_both_correct": 0.859375,
      "oracle_pair_program_consistency": 0.92578125,
      "oracle_pair_state_consistency": 0.92578125,
      "base_pair_answer_consistency": 0.7109375,
      "base_pair_both_correct": 0.28125,
      "base_pair_program_consistency": 0.7109375,
      "base_pair_state_consistency": 0.7109375
    }
  },
  "train_log": [
    {
      "epoch": 1,
      "stage": "small",
      "stage_epoch": 1,
      "stage_topk": 2,
      "stage_max_edits": 1,
      "stage_max_pair_arg_slots": 8,
      "train_loss": 0.6889738687277251,
      "val_n": 128.0,
      "val_oracle_found_fraction": 0.8515625,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.296875,
      "val_base_executor_accuracy": 0.3203125,
      "val_base_program_exact": 0.3203125,
      "val_base_state_prefix_fraction": 0.5787760416666666,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.3203125,
      "val_prior_program_exact": 0.3203125,
      "val_prior_state_prefix_fraction": 0.5787760416666666,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.2125651041666666,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.671875,
      "val_oracle_executor_accuracy": 0.8515625,
      "val_oracle_program_exact": 0.84375,
      "val_oracle_state_prefix_fraction": 0.8798828125,
      "val_oracle_changed_fraction": 0.53125,
      "val_oracle_avg_edits": 0.7109375,
      "val_learned_executor_accuracy": 0.3203125,
      "val_learned_program_exact": 0.3203125,
      "val_learned_state_prefix_fraction": 0.5787760416666666,
      "val_learned_changed_fraction": 0.0,
      "val_learned_avg_edits": 0.0,
      "val_learned_oracle_gap_recovered": 0.0
    },
    {
      "epoch": 2,
      "stage": "small",
      "stage_epoch": 2,
      "stage_topk": 2,
      "stage_max_edits": 1,
      "stage_max_pair_arg_slots": 8,
      "train_loss": 0.5652745344066581,
      "val_n": 128.0,
      "val_oracle_found_fraction": 0.8515625,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.296875,
      "val_base_executor_accuracy": 0.3203125,
      "val_base_program_exact": 0.3203125,
      "val_base_state_prefix_fraction": 0.5787760416666666,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.3203125,
      "val_prior_program_exact": 0.3203125,
      "val_prior_state_prefix_fraction": 0.5787760416666666,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.2125651041666666,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.671875,
      "val_oracle_executor_accuracy": 0.8515625,
      "val_oracle_program_exact": 0.84375,
      "val_oracle_state_prefix_fraction": 0.8798828125,
      "val_oracle_changed_fraction": 0.53125,
      "val_oracle_avg_edits": 0.7109375,
      "val_learned_executor_accuracy": 0.3203125,
      "val_learned_program_exact": 0.3203125,
      "val_learned_state_prefix_fraction": 0.5787760416666666,
      "val_learned_changed_fraction": 0.0,
      "val_learned_avg_edits": 0.0,
      "val_learned_oracle_gap_recovered": 0.0
    },
    {
      "epoch": 3,
      "stage": "small",
      "stage_epoch": 3,
      "stage_topk": 2,
      "stage_max_edits": 1,
      "stage_max_pair_arg_slots": 8,
      "train_loss": 0.5435180176386911,
      "val_n": 128.0,
      "val_oracle_found_fraction": 0.8515625,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.296875,
      "val_base_executor_accuracy": 0.3203125,
      "val_base_program_exact": 0.3203125,
      "val_base_state_prefix_fraction": 0.5787760416666666,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.3203125,
      "val_prior_program_exact": 0.3203125,
      "val_prior_state_prefix_fraction": 0.5787760416666666,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.2125651041666666,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.671875,
      "val_oracle_executor_accuracy": 0.8515625,
      "val_oracle_program_exact": 0.84375,
      "val_oracle_state_prefix_fraction": 0.8798828125,
      "val_oracle_changed_fraction": 0.53125,
      "val_oracle_avg_edits": 0.7109375,
      "val_learned_executor_accuracy": 0.3203125,
      "val_learned_program_exact": 0.3203125,
      "val_learned_state_prefix_fraction": 0.5787760416666666,
      "val_learned_changed_fraction": 0.0,
      "val_learned_avg_edits": 0.0,
      "val_learned_oracle_gap_recovered": 0.0
    },
    {
      "epoch": 4,
      "stage": "medium",
      "stage_epoch": 1,
      "stage_topk": 3,
      "stage_max_edits": 1,
      "stage_max_pair_arg_slots": 16,
      "train_loss": 1.8010581851628942,
      "val_n": 128.0,
      "val_oracle_found_fraction": 0.8515625,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.296875,
      "val_base_executor_accuracy": 0.3203125,
      "val_base_program_exact": 0.3203125,
      "val_base_state_prefix_fraction": 0.5787760416666666,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.3203125,
      "val_prior_program_exact": 0.3203125,
      "val_prior_state_prefix_fraction": 0.5787760416666666,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.2125651041666666,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.671875,
      "val_oracle_executor_accuracy": 0.8515625,
      "val_oracle_program_exact": 0.84375,
      "val_oracle_state_prefix_fraction": 0.8798828125,
      "val_oracle_changed_fraction": 0.53125,
      "val_oracle_avg_edits": 0.7109375,
      "val_learned_executor_accuracy": 0.3203125,
      "val_learned_program_exact": 0.3203125,
      "val_learned_state_prefix_fraction": 0.5787760416666666,
      "val_learned_changed_fraction": 0.0,
      "val_learned_avg_edits": 0.0,
      "val_learned_oracle_gap_recovered": 0.0
    },
    {
      "epoch": 5,
      "stage": "medium",
      "stage_epoch": 2,
      "stage_topk": 3,
      "stage_max_edits": 1,
      "stage_max_pair_arg_slots": 16,
      "train_loss": 1.489117588442653,
      "val_n": 128.0,
      "val_oracle_found_fraction": 0.8515625,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.296875,
      "val_base_executor_accuracy": 0.3203125,
      "val_base_program_exact": 0.3203125,
      "val_base_state_prefix_fraction": 0.5787760416666666,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.3203125,
      "val_prior_program_exact": 0.3203125,
      "val_prior_state_prefix_fraction": 0.5787760416666666,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.2125651041666666,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.671875,
      "val_oracle_executor_accuracy": 0.8515625,
      "val_oracle_program_exact": 0.84375,
      "val_oracle_state_prefix_fraction": 0.8798828125,
      "val_oracle_changed_fraction": 0.53125,
      "val_oracle_avg_edits": 0.7109375,
      "val_learned_executor_accuracy": 0.3203125,
      "val_learned_program_exact": 0.3203125,
      "val_learned_state_prefix_fraction": 0.5787760416666666,
      "val_learned_changed_fraction": 0.0,
      "val_learned_avg_edits": 0.0,
      "val_learned_oracle_gap_recovered": 0.0
    },
    {
      "epoch": 6,
      "stage": "medium",
      "stage_epoch": 3,
      "stage_topk": 3,
      "stage_max_edits": 1,
      "stage_max_pair_arg_slots": 16,
      "train_loss": 1.4350029123733918,
      "val_n": 128.0,
      "val_oracle_found_fraction": 0.8515625,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.296875,
      "val_base_executor_accuracy": 0.3203125,
      "val_base_program_exact": 0.3203125,
      "val_base_state_prefix_fraction": 0.5787760416666666,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.3203125,
      "val_prior_program_exact": 0.3203125,
      "val_prior_state_prefix_fraction": 0.5787760416666666,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.2125651041666666,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.671875,
      "val_oracle_executor_accuracy": 0.8515625,
      "val_oracle_program_exact": 0.84375,
      "val_oracle_state_prefix_fraction": 0.8798828125,
      "val_oracle_changed_fraction": 0.53125,
      "val_oracle_avg_edits": 0.7109375,
      "val_learned_executor_accuracy": 0.3203125,
      "val_learned_program_exact": 0.3203125,
      "val_learned_state_prefix_fraction": 0.5787760416666666,
      "val_learned_changed_fraction": 0.0,
      "val_learned_avg_edits": 0.0,
      "val_learned_oracle_gap_recovered": 0.0
    },
    {
      "epoch": 7,
      "stage": "medium",
      "stage_epoch": 4,
      "stage_topk": 3,
      "stage_max_edits": 1,
      "stage_max_pair_arg_slots": 16,
      "train_loss": 1.3729752321567048,
      "val_n": 128.0,
      "val_oracle_found_fraction": 0.8515625,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.296875,
      "val_base_executor_accuracy": 0.3203125,
      "val_base_program_exact": 0.3203125,
      "val_base_state_prefix_fraction": 0.5787760416666666,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.3203125,
      "val_prior_program_exact": 0.3203125,
      "val_prior_state_prefix_fraction": 0.5787760416666666,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.2125651041666666,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.671875,
      "val_oracle_executor_accuracy": 0.8515625,
      "val_oracle_program_exact": 0.84375,
      "val_oracle_state_prefix_fraction": 0.8798828125,
      "val_oracle_changed_fraction": 0.53125,
      "val_oracle_avg_edits": 0.7109375,
      "val_learned_executor_accuracy": 0.328125,
      "val_learned_program_exact": 0.328125,
      "val_learned_state_prefix_fraction": 0.5807291666666667,
      "val_learned_changed_fraction": 0.03125,
      "val_learned_avg_edits": 0.0625,
      "val_learned_oracle_gap_recovered": 0.014705882352941176
    },
    {
      "epoch": 8,
      "stage": "full",
      "stage_epoch": 1,
      "stage_topk": 3,
      "stage_max_edits": 2,
      "stage_max_pair_arg_slots": 24,
      "train_loss": 2.7799516747309028,
      "val_n": 128.0,
      "val_oracle_found_fraction": 0.8515625,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.296875,
      "val_base_executor_accuracy": 0.3203125,
      "val_base_program_exact": 0.3203125,
      "val_base_state_prefix_fraction": 0.5787760416666666,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.3203125,
      "val_prior_program_exact": 0.3203125,
      "val_prior_state_prefix_fraction": 0.5787760416666666,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.2125651041666666,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.671875,
      "val_oracle_executor_accuracy": 0.8515625,
      "val_oracle_program_exact": 0.84375,
      "val_oracle_state_prefix_fraction": 0.8798828125,
      "val_oracle_changed_fraction": 0.53125,
      "val_oracle_avg_edits": 0.7109375,
      "val_learned_executor_accuracy": 0.3984375,
      "val_learned_program_exact": 0.3984375,
      "val_learned_state_prefix_fraction": 0.645182291666667,
      "val_learned_changed_fraction": 0.234375,
      "val_learned_avg_edits": 0.234375,
      "val_learned_oracle_gap_recovered": 0.14705882352941177
    },
    {
      "epoch": 9,
      "stage": "full",
      "stage_epoch": 2,
      "stage_topk": 3,
      "stage_max_edits": 2,
      "stage_max_pair_arg_slots": 24,
      "train_loss": 2.4786843947887007,
      "val_n": 128.0,
      "val_oracle_found_fraction": 0.8515625,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.296875,
      "val_base_executor_accuracy": 0.3203125,
      "val_base_program_exact": 0.3203125,
      "val_base_state_prefix_fraction": 0.5787760416666666,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.3203125,
      "val_prior_program_exact": 0.3203125,
      "val_prior_state_prefix_fraction": 0.5787760416666666,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.2125651041666666,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.671875,
      "val_oracle_executor_accuracy": 0.8515625,
      "val_oracle_program_exact": 0.84375,
      "val_oracle_state_prefix_fraction": 0.8798828125,
      "val_oracle_changed_fraction": 0.53125,
      "val_oracle_avg_edits": 0.7109375,
      "val_learned_executor_accuracy": 0.4765625,
      "val_learned_program_exact": 0.4765625,
      "val_learned_state_prefix_fraction": 0.697265625,
      "val_learned_changed_fraction": 0.4375,
      "val_learned_avg_edits": 0.4375,
      "val_learned_oracle_gap_recovered": 0.29411764705882354
    },
    {
      "epoch": 10,
      "stage": "full",
      "stage_epoch": 3,
      "stage_topk": 3,
      "stage_max_edits": 2,
      "stage_max_pair_arg_slots": 24,
      "train_loss": 2.273547268177424,
      "val_n": 128.0,
      "val_oracle_found_fraction": 0.8515625,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.296875,
      "val_base_executor_accuracy": 0.3203125,
      "val_base_program_exact": 0.3203125,
      "val_base_state_prefix_fraction": 0.5787760416666666,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.3203125,
      "val_prior_program_exact": 0.3203125,
      "val_prior_state_prefix_fraction": 0.5787760416666666,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.2125651041666666,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.671875,
      "val_oracle_executor_accuracy": 0.8515625,
      "val_oracle_program_exact": 0.84375,
      "val_oracle_state_prefix_fraction": 0.8798828125,
      "val_oracle_changed_fraction": 0.53125,
      "val_oracle_avg_edits": 0.7109375,
      "val_learned_executor_accuracy": 0.390625,
      "val_learned_program_exact": 0.390625,
      "val_learned_state_prefix_fraction": 0.6360677083333336,
      "val_learned_changed_fraction": 0.2265625,
      "val_learned_avg_edits": 0.2265625,
      "val_learned_oracle_gap_recovered": 0.1323529411764706
    },
    {
      "epoch": 11,
      "stage": "full",
      "stage_epoch": 4,
      "stage_topk": 3,
      "stage_max_edits": 2,
      "stage_max_pair_arg_slots": 24,
      "train_loss": 2.22480290903278,
      "val_n": 128.0,
      "val_oracle_found_fraction": 0.8515625,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.296875,
      "val_base_executor_accuracy": 0.3203125,
      "val_base_program_exact": 0.3203125,
      "val_base_state_prefix_fraction": 0.5787760416666666,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.3203125,
      "val_prior_program_exact": 0.3203125,
      "val_prior_state_prefix_fraction": 0.5787760416666666,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.2125651041666666,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.671875,
      "val_oracle_executor_accuracy": 0.8515625,
      "val_oracle_program_exact": 0.84375,
      "val_oracle_state_prefix_fraction": 0.8798828125,
      "val_oracle_changed_fraction": 0.53125,
      "val_oracle_avg_edits": 0.7109375,
      "val_learned_executor_accuracy": 0.4609375,
      "val_learned_program_exact": 0.4609375,
      "val_learned_state_prefix_fraction": 0.7194010416666666,
      "val_learned_changed_fraction": 0.375,
      "val_learned_avg_edits": 0.4375,
      "val_learned_oracle_gap_recovered": 0.2647058823529412
    },
    {
      "epoch": 12,
      "stage": "full",
      "stage_epoch": 5,
      "stage_topk": 3,
      "stage_max_edits": 2,
      "stage_max_pair_arg_slots": 24,
      "train_loss": 2.1686716446317953,
      "val_n": 128.0,
      "val_oracle_found_fraction": 0.8515625,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.296875,
      "val_base_executor_accuracy": 0.3203125,
      "val_base_program_exact": 0.3203125,
      "val_base_state_prefix_fraction": 0.5787760416666666,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.3203125,
      "val_prior_program_exact": 0.3203125,
      "val_prior_state_prefix_fraction": 0.5787760416666666,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.2125651041666666,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.671875,
      "val_oracle_executor_accuracy": 0.8515625,
      "val_oracle_program_exact": 0.84375,
      "val_oracle_state_prefix_fraction": 0.8798828125,
      "val_oracle_changed_fraction": 0.53125,
      "val_oracle_avg_edits": 0.7109375,
      "val_learned_executor_accuracy": 0.4921875,
      "val_learned_program_exact": 0.4921875,
      "val_learned_state_prefix_fraction": 0.7161458333333333,
      "val_learned_changed_fraction": 0.453125,
      "val_learned_avg_edits": 0.53125,
      "val_learned_oracle_gap_recovered": 0.3235294117647059
    },
    {
      "epoch": 13,
      "stage": "full",
      "stage_epoch": 6,
      "stage_topk": 3,
      "stage_max_edits": 2,
      "stage_max_pair_arg_slots": 24,
      "train_loss": 2.105265962372851,
      "val_n": 128.0,
      "val_oracle_found_fraction": 0.8515625,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.296875,
      "val_base_executor_accuracy": 0.3203125,
      "val_base_program_exact": 0.3203125,
      "val_base_state_prefix_fraction": 0.5787760416666666,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.3203125,
      "val_prior_program_exact": 0.3203125,
      "val_prior_state_prefix_fraction": 0.5787760416666666,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.2125651041666666,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.671875,
      "val_oracle_executor_accuracy": 0.8515625,
      "val_oracle_program_exact": 0.84375,
      "val_oracle_state_prefix_fraction": 0.8798828125,
      "val_oracle_changed_fraction": 0.53125,
      "val_oracle_avg_edits": 0.7109375,
      "val_learned_executor_accuracy": 0.46875,
      "val_learned_program_exact": 0.46875,
      "val_learned_state_prefix_fraction": 0.7337239583333335,
      "val_learned_changed_fraction": 0.390625,
      "val_learned_avg_edits": 0.5078125,
      "val_learned_oracle_gap_recovered": 0.27941176470588236
    },
    {
      "epoch": 14,
      "stage": "full",
      "stage_epoch": 7,
      "stage_topk": 3,
      "stage_max_edits": 2,
      "stage_max_pair_arg_slots": 24,
      "train_loss": 2.072758000724207,
      "val_n": 128.0,
      "val_oracle_found_fraction": 0.8515625,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.296875,
      "val_base_executor_accuracy": 0.3203125,
      "val_base_program_exact": 0.3203125,
      "val_base_state_prefix_fraction": 0.5787760416666666,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.3203125,
      "val_prior_program_exact": 0.3203125,
      "val_prior_state_prefix_fraction": 0.5787760416666666,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.2125651041666666,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.671875,
      "val_oracle_executor_accuracy": 0.8515625,
      "val_oracle_program_exact": 0.84375,
      "val_oracle_state_prefix_fraction": 0.8798828125,
      "val_oracle_changed_fraction": 0.53125,
      "val_oracle_avg_edits": 0.7109375,
      "val_learned_executor_accuracy": 0.53125,
      "val_learned_program_exact": 0.53125,
      "val_learned_state_prefix_fraction": 0.7389322916666667,
      "val_learned_changed_fraction": 0.515625,
      "val_learned_avg_edits": 0.59375,
      "val_learned_oracle_gap_recovered": 0.39705882352941174
    },
    {
      "epoch": 15,
      "stage": "full",
      "stage_epoch": 8,
      "stage_topk": 3,
      "stage_max_edits": 2,
      "stage_max_pair_arg_slots": 24,
      "train_loss": 2.033218980426682,
      "val_n": 128.0,
      "val_oracle_found_fraction": 0.8515625,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.296875,
      "val_base_executor_accuracy": 0.3203125,
      "val_base_program_exact": 0.3203125,
      "val_base_state_prefix_fraction": 0.5787760416666666,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.3203125,
      "val_prior_program_exact": 0.3203125,
      "val_prior_state_prefix_fraction": 0.5787760416666666,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.2125651041666666,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.671875,
      "val_oracle_executor_accuracy": 0.8515625,
      "val_oracle_program_exact": 0.84375,
      "val_oracle_state_prefix_fraction": 0.8798828125,
      "val_oracle_changed_fraction": 0.53125,
      "val_oracle_avg_edits": 0.7109375,
      "val_learned_executor_accuracy": 0.515625,
      "val_learned_program_exact": 0.515625,
      "val_learned_state_prefix_fraction": 0.7532552083333333,
      "val_learned_changed_fraction": 0.515625,
      "val_learned_avg_edits": 0.6484375,
      "val_learned_oracle_gap_recovered": 0.36764705882352944
    },
    {
      "epoch": 16,
      "stage": "full",
      "stage_epoch": 9,
      "stage_topk": 3,
      "stage_max_edits": 2,
      "stage_max_pair_arg_slots": 24,
      "train_loss": 1.9808867719398222,
      "val_n": 128.0,
      "val_oracle_found_fraction": 0.8515625,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.296875,
      "val_base_executor_accuracy": 0.3203125,
      "val_base_program_exact": 0.3203125,
      "val_base_state_prefix_fraction": 0.5787760416666666,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.3203125,
      "val_prior_program_exact": 0.3203125,
      "val_prior_state_prefix_fraction": 0.5787760416666666,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.2125651041666666,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.671875,
      "val_oracle_executor_accuracy": 0.8515625,
      "val_oracle_program_exact": 0.84375,
      "val_oracle_state_prefix_fraction": 0.8798828125,
      "val_oracle_changed_fraction": 0.53125,
      "val_oracle_avg_edits": 0.7109375,
      "val_learned_executor_accuracy": 0.46875,
      "val_learned_program_exact": 0.46875,
      "val_learned_state_prefix_fraction": 0.7242838541666669,
      "val_learned_changed_fraction": 0.390625,
      "val_learned_avg_edits": 0.5078125,
      "val_learned_oracle_gap_recovered": 0.27941176470588236
    },
    {
      "epoch": 17,
      "stage": "full",
      "stage_epoch": 10,
      "stage_topk": 3,
      "stage_max_edits": 2,
      "stage_max_pair_arg_slots": 24,
      "train_loss": 1.8953042229003614,
      "val_n": 128.0,
      "val_oracle_found_fraction": 0.8515625,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.296875,
      "val_base_executor_accuracy": 0.3203125,
      "val_base_program_exact": 0.3203125,
      "val_base_state_prefix_fraction": 0.5787760416666666,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.3203125,
      "val_prior_program_exact": 0.3203125,
      "val_prior_state_prefix_fraction": 0.5787760416666666,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.2125651041666666,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.671875,
      "val_oracle_executor_accuracy": 0.8515625,
      "val_oracle_program_exact": 0.84375,
      "val_oracle_state_prefix_fraction": 0.8798828125,
      "val_oracle_changed_fraction": 0.53125,
      "val_oracle_avg_edits": 0.7109375,
      "val_learned_executor_accuracy": 0.4140625,
      "val_learned_program_exact": 0.4140625,
      "val_learned_state_prefix_fraction": 0.6783854166666669,
      "val_learned_changed_fraction": 0.21875,
      "val_learned_avg_edits": 0.2890625,
      "val_learned_oracle_gap_recovered": 0.17647058823529413
    },
    {
      "epoch": 18,
      "stage": "full",
      "stage_epoch": 11,
      "stage_topk": 3,
      "stage_max_edits": 2,
      "stage_max_pair_arg_slots": 24,
      "train_loss": 1.804170270681868,
      "val_n": 128.0,
      "val_oracle_found_fraction": 0.8515625,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.296875,
      "val_base_executor_accuracy": 0.3203125,
      "val_base_program_exact": 0.3203125,
      "val_base_state_prefix_fraction": 0.5787760416666666,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.3203125,
      "val_prior_program_exact": 0.3203125,
      "val_prior_state_prefix_fraction": 0.5787760416666666,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.2125651041666666,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.671875,
      "val_oracle_executor_accuracy": 0.8515625,
      "val_oracle_program_exact": 0.84375,
      "val_oracle_state_prefix_fraction": 0.8798828125,
      "val_oracle_changed_fraction": 0.53125,
      "val_oracle_avg_edits": 0.7109375,
      "val_learned_executor_accuracy": 0.484375,
      "val_learned_program_exact": 0.484375,
      "val_learned_state_prefix_fraction": 0.7327473958333333,
      "val_learned_changed_fraction": 0.453125,
      "val_learned_avg_edits": 0.5625,
      "val_learned_oracle_gap_recovered": 0.3088235294117647
    }
  ]
}