{
  "metadata": {
    "python": "3.12.3",
    "platform": "Linux-6.8.0-62-generic-x86_64-with-glibc2.39",
    "torch": "2.8.0+cu128",
    "cuda_available": true,
    "gpu_name": "NVIDIA RTX 6000 Ada Generation",
    "args": {
      "run_name": "pilot_progressive_repair_s96",
      "compiler_checkpoint": "large_artifacts/qwen_progressive_repair_compiler/checkpoints/fixed_compiler_step00800",
      "train_examples": 96,
      "val_examples": 48,
      "eval_examples": 64,
      "eval_pairs": 64,
      "train_length": 24,
      "eval_length": 24,
      "train_template_modes": "standard,paraphrase",
      "repair_topk": 3,
      "repair_max_edits": 2,
      "repair_max_pair_arg_slots": 24,
      "candidate_curriculum": "small:2:1:8:2,full:3:2:24:6",
      "qwen_batch_size": 8,
      "max_length": 384,
      "trace_d_model": 96,
      "trace_layers": 2,
      "trace_heads": 4,
      "trace_ff_mult": 4,
      "verifier_dropout": 0.05,
      "verifier_epochs": 8,
      "verifier_lr": 0.001,
      "verifier_weight_decay": 0.0001,
      "no_positive_base_weight": 0.2,
      "grad_clip": 1.0,
      "pair_top_m": 25,
      "pair_bonus": 2.0,
      "seed": 41,
      "eval_seed": 41001
    },
    "compiler_args": {
      "model_id": "Qwen/Qwen3-4B",
      "modulus": 97,
      "max_steps": 24,
      "head_width": 768,
      "rank_temperature": 1.0,
      "arg_reader_mode": "after_op",
      "arg_window": 8,
      "arg_distance_temperature": 2.0
    },
    "feature_names": [
      "bias",
      "candidate_prior",
      "prior_delta",
      "candidate_prior_per_slot",
      "prior_delta_per_edit",
      "base_prior",
      "edit_count",
      "changed",
      "init_edit",
      "op_edit_count",
      "arg_edit_count",
      "edit_fraction",
      "first_edit_pos_norm",
      "last_edit_pos_norm",
      "mean_edit_pos_norm",
      "edit_span_norm",
      "mean_new_rank",
      "max_new_rank",
      "mean_changed_margin",
      "min_changed_margin",
      "mean_changed_entropy",
      "mean_logp_delta",
      "min_logp_delta",
      "max_logp_delta",
      "base_init_margin",
      "base_op_margin_mean",
      "base_op_margin_min",
      "base_arg_margin_mean",
      "base_arg_margin_min",
      "base_op_entropy_mean",
      "base_arg_entropy_mean",
      "candidate_answer_norm",
      "candidate_final_soft_logp",
      "candidate_state_soft_logp_mean",
      "candidate_state_soft_logp_min",
      "base_final_soft_logp",
      "base_state_soft_logp_mean",
      "answer_equals_base",
      "state_same_fraction_as_base",
      "state_prefix_same_as_base",
      "mean_old_value_norm",
      "mean_new_value_norm",
      "mean_abs_value_delta_norm",
      "arg_new_value_mean_norm",
      "arg_abs_delta_mean_norm",
      "op_new_add_frac",
      "op_new_sub_frac",
      "op_new_mul_frac",
      "candidate_add_frac",
      "candidate_sub_frac",
      "candidate_mul_frac",
      "candidate_arg_mean_norm",
      "candidate_arg_std_norm",
      "base_add_frac",
      "base_sub_frac",
      "base_mul_frac"
    ],
    "trace_feature_names": [
      "is_global",
      "is_step",
      "active",
      "step_pos_norm",
      "candidate_prior",
      "prior_delta",
      "edit_count",
      "init_value_norm",
      "init_changed",
      "answer_norm",
      "final_soft_logp",
      "base_final_soft_logp",
      "answer_equals_base",
      "op_add",
      "op_sub",
      "op_mul",
      "arg_norm",
      "state_norm",
      "state_soft_logp",
      "base_op_add",
      "base_op_sub",
      "base_op_mul",
      "base_arg_norm",
      "base_state_norm",
      "base_state_soft_logp",
      "op_changed",
      "arg_changed",
      "state_same_as_base",
      "op_logp",
      "arg_logp",
      "op_logp_delta",
      "arg_logp_delta",
      "op_margin",
      "arg_margin",
      "op_entropy",
      "arg_entropy"
    ],
    "candidate_curriculum_stages": [
      {
        "name": "small",
        "topk": 2,
        "max_edits": 1,
        "max_pair_arg_slots": 8,
        "epochs": 2
      },
      {
        "name": "full",
        "topk": 3,
        "max_edits": 2,
        "max_pair_arg_slots": 24,
        "epochs": 6
      }
    ],
    "train_seconds": 175.6177089214325
  },
  "metrics": {
    "train_len24": {
      "n": 96.0,
      "oracle_found_fraction": 0.8125,
      "avg_candidates": 1299.0,
      "avg_positive_candidates": 1.1458333333333333,
      "base_executor_accuracy": 0.22916666666666666,
      "base_program_exact": 0.22916666666666666,
      "base_state_prefix_fraction": 0.5190972222222222,
      "base_changed_fraction": 0.0,
      "base_avg_edits": 0.0,
      "prior_executor_accuracy": 0.22916666666666666,
      "prior_program_exact": 0.22916666666666666,
      "prior_state_prefix_fraction": 0.5190972222222222,
      "prior_changed_fraction": 0.0,
      "prior_avg_edits": 0.0,
      "soft_trace_executor_accuracy": 0.0,
      "soft_trace_program_exact": 0.0,
      "soft_trace_state_prefix_fraction": 0.22135416666666663,
      "soft_trace_changed_fraction": 1.0,
      "soft_trace_avg_edits": 1.6875,
      "oracle_executor_accuracy": 0.8125,
      "oracle_program_exact": 0.8020833333333334,
      "oracle_state_prefix_fraction": 0.8546006944444445,
      "oracle_changed_fraction": 0.5833333333333334,
      "oracle_avg_edits": 0.8333333333333334,
      "learned_executor_accuracy": 0.5,
      "learned_program_exact": 0.4895833333333333,
      "learned_state_prefix_fraction": 0.7326388888888887,
      "learned_changed_fraction": 0.5625,
      "learned_avg_edits": 0.7604166666666666,
      "learned_oracle_gap_recovered": 0.4642857142857143
    },
    "val_len24": {
      "n": 48.0,
      "oracle_found_fraction": 0.8541666666666666,
      "avg_candidates": 1299.0,
      "avg_positive_candidates": 1.1875,
      "base_executor_accuracy": 0.375,
      "base_program_exact": 0.375,
      "base_state_prefix_fraction": 0.5885416666666665,
      "base_changed_fraction": 0.0,
      "base_avg_edits": 0.0,
      "prior_executor_accuracy": 0.375,
      "prior_program_exact": 0.375,
      "prior_state_prefix_fraction": 0.5885416666666665,
      "prior_changed_fraction": 0.0,
      "prior_avg_edits": 0.0,
      "soft_trace_executor_accuracy": 0.0,
      "soft_trace_program_exact": 0.0,
      "soft_trace_state_prefix_fraction": 0.19704861111111105,
      "soft_trace_changed_fraction": 1.0,
      "soft_trace_avg_edits": 1.6458333333333333,
      "oracle_executor_accuracy": 0.8541666666666666,
      "oracle_program_exact": 0.8541666666666666,
      "oracle_state_prefix_fraction": 0.888888888888889,
      "oracle_changed_fraction": 0.4791666666666667,
      "oracle_avg_edits": 0.7291666666666666,
      "learned_executor_accuracy": 0.4583333333333333,
      "learned_program_exact": 0.4583333333333333,
      "learned_state_prefix_fraction": 0.6831597222222222,
      "learned_changed_fraction": 0.3541666666666667,
      "learned_avg_edits": 0.4791666666666667,
      "learned_oracle_gap_recovered": 0.17391304347826084
    },
    "fresh_standard_len24": {
      "n": 64.0,
      "oracle_found_fraction": 0.875,
      "avg_candidates": 1299.0,
      "avg_positive_candidates": 1.28125,
      "base_executor_accuracy": 0.328125,
      "base_program_exact": 0.328125,
      "base_state_prefix_fraction": 0.5703124999999998,
      "base_changed_fraction": 0.0,
      "base_avg_edits": 0.0,
      "prior_executor_accuracy": 0.328125,
      "prior_program_exact": 0.328125,
      "prior_state_prefix_fraction": 0.5703124999999998,
      "prior_changed_fraction": 0.0,
      "prior_avg_edits": 0.0,
      "soft_trace_executor_accuracy": 0.0,
      "soft_trace_program_exact": 0.0,
      "soft_trace_state_prefix_fraction": 0.2109375,
      "soft_trace_changed_fraction": 1.0,
      "soft_trace_avg_edits": 1.65625,
      "oracle_executor_accuracy": 0.875,
      "oracle_program_exact": 0.875,
      "oracle_state_prefix_fraction": 0.8860677083333333,
      "oracle_changed_fraction": 0.546875,
      "oracle_avg_edits": 0.765625,
      "learned_executor_accuracy": 0.546875,
      "learned_program_exact": 0.546875,
      "learned_state_prefix_fraction": 0.7011718749999999,
      "learned_changed_fraction": 0.40625,
      "learned_avg_edits": 0.484375,
      "learned_oracle_gap_recovered": 0.4
    },
    "fresh_paraphrase_len24": {
      "n": 64.0,
      "oracle_found_fraction": 0.953125,
      "avg_candidates": 1299.0,
      "avg_positive_candidates": 1.5,
      "base_executor_accuracy": 0.296875,
      "base_program_exact": 0.296875,
      "base_state_prefix_fraction": 0.5468749999999999,
      "base_changed_fraction": 0.0,
      "base_avg_edits": 0.0,
      "prior_executor_accuracy": 0.296875,
      "prior_program_exact": 0.296875,
      "prior_state_prefix_fraction": 0.5468749999999999,
      "prior_changed_fraction": 0.0,
      "prior_avg_edits": 0.0,
      "soft_trace_executor_accuracy": 0.0,
      "soft_trace_program_exact": 0.0,
      "soft_trace_state_prefix_fraction": 0.19531250000000003,
      "soft_trace_changed_fraction": 1.0,
      "soft_trace_avg_edits": 1.703125,
      "oracle_executor_accuracy": 0.953125,
      "oracle_program_exact": 0.953125,
      "oracle_state_prefix_fraction": 0.95703125,
      "oracle_changed_fraction": 0.65625,
      "oracle_avg_edits": 0.90625,
      "learned_executor_accuracy": 0.453125,
      "learned_program_exact": 0.453125,
      "learned_state_prefix_fraction": 0.6953125,
      "learned_changed_fraction": 0.40625,
      "learned_avg_edits": 0.546875,
      "learned_oracle_gap_recovered": 0.23809523809523808
    },
    "fresh_paired_len24": {
      "n": 128.0,
      "oracle_found_fraction": 0.875,
      "avg_candidates": 1299.0,
      "avg_positive_candidates": 1.2265625,
      "base_executor_accuracy": 0.28125,
      "base_program_exact": 0.28125,
      "base_state_prefix_fraction": 0.5465494791666665,
      "base_changed_fraction": 0.0,
      "base_avg_edits": 0.0,
      "prior_executor_accuracy": 0.28125,
      "prior_program_exact": 0.28125,
      "prior_state_prefix_fraction": 0.5465494791666665,
      "prior_changed_fraction": 0.0,
      "prior_avg_edits": 0.0,
      "soft_trace_executor_accuracy": 0.0,
      "soft_trace_program_exact": 0.0,
      "soft_trace_state_prefix_fraction": 0.21093749999999994,
      "soft_trace_changed_fraction": 1.0,
      "soft_trace_avg_edits": 1.671875,
      "oracle_executor_accuracy": 0.875,
      "oracle_program_exact": 0.875,
      "oracle_state_prefix_fraction": 0.9020182291666666,
      "oracle_changed_fraction": 0.59375,
      "oracle_avg_edits": 0.8125,
      "learned_executor_accuracy": 0.40625,
      "learned_program_exact": 0.40625,
      "learned_state_prefix_fraction": 0.7041015624999998,
      "learned_changed_fraction": 0.3984375,
      "learned_avg_edits": 0.46875,
      "learned_oracle_gap_recovered": 0.21052631578947367,
      "pair_rerank_executor_accuracy": 0.421875,
      "pair_rerank_program_exact": 0.421875,
      "pair_rerank_state_prefix_fraction": 0.7132161458333331,
      "pair_rerank_changed_fraction": 0.390625,
      "pair_rerank_avg_edits": 0.453125,
      "learned_pair_answer_consistency": 0.578125,
      "learned_pair_both_correct": 0.328125,
      "learned_pair_program_consistency": 0.578125,
      "learned_pair_state_consistency": 0.578125,
      "pair_rerank_pair_answer_consistency": 0.890625,
      "pair_rerank_pair_both_correct": 0.40625,
      "pair_rerank_pair_program_consistency": 0.890625,
      "pair_rerank_pair_state_consistency": 0.890625,
      "oracle_pair_answer_consistency": 0.875,
      "oracle_pair_both_correct": 0.84375,
      "oracle_pair_program_consistency": 0.875,
      "oracle_pair_state_consistency": 0.875,
      "base_pair_answer_consistency": 0.65625,
      "base_pair_both_correct": 0.265625,
      "base_pair_program_consistency": 0.65625,
      "base_pair_state_consistency": 0.65625
    }
  },
  "train_log": [
    {
      "epoch": 1,
      "stage": "small",
      "stage_epoch": 1,
      "stage_topk": 2,
      "stage_max_edits": 1,
      "stage_max_pair_arg_slots": 8,
      "train_loss": 0.7115414057105909,
      "val_n": 48.0,
      "val_oracle_found_fraction": 0.8541666666666666,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.1875,
      "val_base_executor_accuracy": 0.375,
      "val_base_program_exact": 0.375,
      "val_base_state_prefix_fraction": 0.5885416666666665,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.375,
      "val_prior_program_exact": 0.375,
      "val_prior_state_prefix_fraction": 0.5885416666666665,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.19704861111111105,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.6458333333333333,
      "val_oracle_executor_accuracy": 0.8541666666666666,
      "val_oracle_program_exact": 0.8541666666666666,
      "val_oracle_state_prefix_fraction": 0.888888888888889,
      "val_oracle_changed_fraction": 0.4791666666666667,
      "val_oracle_avg_edits": 0.7291666666666666,
      "val_learned_executor_accuracy": 0.375,
      "val_learned_program_exact": 0.375,
      "val_learned_state_prefix_fraction": 0.5885416666666665,
      "val_learned_changed_fraction": 0.0,
      "val_learned_avg_edits": 0.0,
      "val_learned_oracle_gap_recovered": 0.0
    },
    {
      "epoch": 2,
      "stage": "small",
      "stage_epoch": 2,
      "stage_topk": 2,
      "stage_max_edits": 1,
      "stage_max_pair_arg_slots": 8,
      "train_loss": 0.6393190227290688,
      "val_n": 48.0,
      "val_oracle_found_fraction": 0.8541666666666666,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.1875,
      "val_base_executor_accuracy": 0.375,
      "val_base_program_exact": 0.375,
      "val_base_state_prefix_fraction": 0.5885416666666665,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.375,
      "val_prior_program_exact": 0.375,
      "val_prior_state_prefix_fraction": 0.5885416666666665,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.19704861111111105,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.6458333333333333,
      "val_oracle_executor_accuracy": 0.8541666666666666,
      "val_oracle_program_exact": 0.8541666666666666,
      "val_oracle_state_prefix_fraction": 0.888888888888889,
      "val_oracle_changed_fraction": 0.4791666666666667,
      "val_oracle_avg_edits": 0.7291666666666666,
      "val_learned_executor_accuracy": 0.375,
      "val_learned_program_exact": 0.375,
      "val_learned_state_prefix_fraction": 0.5885416666666665,
      "val_learned_changed_fraction": 0.0,
      "val_learned_avg_edits": 0.0,
      "val_learned_oracle_gap_recovered": 0.0
    },
    {
      "epoch": 3,
      "stage": "full",
      "stage_epoch": 1,
      "stage_topk": 3,
      "stage_max_edits": 2,
      "stage_max_pair_arg_slots": 24,
      "train_loss": 4.613811792204312,
      "val_n": 48.0,
      "val_oracle_found_fraction": 0.8541666666666666,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.1875,
      "val_base_executor_accuracy": 0.375,
      "val_base_program_exact": 0.375,
      "val_base_state_prefix_fraction": 0.5885416666666665,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.375,
      "val_prior_program_exact": 0.375,
      "val_prior_state_prefix_fraction": 0.5885416666666665,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.19704861111111105,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.6458333333333333,
      "val_oracle_executor_accuracy": 0.8541666666666666,
      "val_oracle_program_exact": 0.8541666666666666,
      "val_oracle_state_prefix_fraction": 0.888888888888889,
      "val_oracle_changed_fraction": 0.4791666666666667,
      "val_oracle_avg_edits": 0.7291666666666666,
      "val_learned_executor_accuracy": 0.375,
      "val_learned_program_exact": 0.375,
      "val_learned_state_prefix_fraction": 0.5885416666666665,
      "val_learned_changed_fraction": 0.0,
      "val_learned_avg_edits": 0.0,
      "val_learned_oracle_gap_recovered": 0.0
    },
    {
      "epoch": 4,
      "stage": "full",
      "stage_epoch": 2,
      "stage_topk": 3,
      "stage_max_edits": 2,
      "stage_max_pair_arg_slots": 24,
      "train_loss": 3.0425596580753336,
      "val_n": 48.0,
      "val_oracle_found_fraction": 0.8541666666666666,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.1875,
      "val_base_executor_accuracy": 0.375,
      "val_base_program_exact": 0.375,
      "val_base_state_prefix_fraction": 0.5885416666666665,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.375,
      "val_prior_program_exact": 0.375,
      "val_prior_state_prefix_fraction": 0.5885416666666665,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.19704861111111105,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.6458333333333333,
      "val_oracle_executor_accuracy": 0.8541666666666666,
      "val_oracle_program_exact": 0.8541666666666666,
      "val_oracle_state_prefix_fraction": 0.888888888888889,
      "val_oracle_changed_fraction": 0.4791666666666667,
      "val_oracle_avg_edits": 0.7291666666666666,
      "val_learned_executor_accuracy": 0.375,
      "val_learned_program_exact": 0.375,
      "val_learned_state_prefix_fraction": 0.5885416666666665,
      "val_learned_changed_fraction": 0.0,
      "val_learned_avg_edits": 0.0,
      "val_learned_oracle_gap_recovered": 0.0
    },
    {
      "epoch": 5,
      "stage": "full",
      "stage_epoch": 3,
      "stage_topk": 3,
      "stage_max_edits": 2,
      "stage_max_pair_arg_slots": 24,
      "train_loss": 2.3610243456047706,
      "val_n": 48.0,
      "val_oracle_found_fraction": 0.8541666666666666,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.1875,
      "val_base_executor_accuracy": 0.375,
      "val_base_program_exact": 0.375,
      "val_base_state_prefix_fraction": 0.5885416666666665,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.375,
      "val_prior_program_exact": 0.375,
      "val_prior_state_prefix_fraction": 0.5885416666666665,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.19704861111111105,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.6458333333333333,
      "val_oracle_executor_accuracy": 0.8541666666666666,
      "val_oracle_program_exact": 0.8541666666666666,
      "val_oracle_state_prefix_fraction": 0.888888888888889,
      "val_oracle_changed_fraction": 0.4791666666666667,
      "val_oracle_avg_edits": 0.7291666666666666,
      "val_learned_executor_accuracy": 0.4166666666666667,
      "val_learned_program_exact": 0.4166666666666667,
      "val_learned_state_prefix_fraction": 0.662326388888889,
      "val_learned_changed_fraction": 0.3333333333333333,
      "val_learned_avg_edits": 0.3541666666666667,
      "val_learned_oracle_gap_recovered": 0.08695652173913047
    },
    {
      "epoch": 6,
      "stage": "full",
      "stage_epoch": 4,
      "stage_topk": 3,
      "stage_max_edits": 2,
      "stage_max_pair_arg_slots": 24,
      "train_loss": 2.018177114013838,
      "val_n": 48.0,
      "val_oracle_found_fraction": 0.8541666666666666,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.1875,
      "val_base_executor_accuracy": 0.375,
      "val_base_program_exact": 0.375,
      "val_base_state_prefix_fraction": 0.5885416666666665,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.375,
      "val_prior_program_exact": 0.375,
      "val_prior_state_prefix_fraction": 0.5885416666666665,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.19704861111111105,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.6458333333333333,
      "val_oracle_executor_accuracy": 0.8541666666666666,
      "val_oracle_program_exact": 0.8541666666666666,
      "val_oracle_state_prefix_fraction": 0.888888888888889,
      "val_oracle_changed_fraction": 0.4791666666666667,
      "val_oracle_avg_edits": 0.7291666666666666,
      "val_learned_executor_accuracy": 0.4166666666666667,
      "val_learned_program_exact": 0.4166666666666667,
      "val_learned_state_prefix_fraction": 0.673611111111111,
      "val_learned_changed_fraction": 0.3541666666666667,
      "val_learned_avg_edits": 0.3541666666666667,
      "val_learned_oracle_gap_recovered": 0.08695652173913047
    },
    {
      "epoch": 7,
      "stage": "full",
      "stage_epoch": 5,
      "stage_topk": 3,
      "stage_max_edits": 2,
      "stage_max_pair_arg_slots": 24,
      "train_loss": 1.8319615240906917,
      "val_n": 48.0,
      "val_oracle_found_fraction": 0.8541666666666666,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.1875,
      "val_base_executor_accuracy": 0.375,
      "val_base_program_exact": 0.375,
      "val_base_state_prefix_fraction": 0.5885416666666665,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.375,
      "val_prior_program_exact": 0.375,
      "val_prior_state_prefix_fraction": 0.5885416666666665,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.19704861111111105,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.6458333333333333,
      "val_oracle_executor_accuracy": 0.8541666666666666,
      "val_oracle_program_exact": 0.8541666666666666,
      "val_oracle_state_prefix_fraction": 0.888888888888889,
      "val_oracle_changed_fraction": 0.4791666666666667,
      "val_oracle_avg_edits": 0.7291666666666666,
      "val_learned_executor_accuracy": 0.4583333333333333,
      "val_learned_program_exact": 0.4583333333333333,
      "val_learned_state_prefix_fraction": 0.6831597222222222,
      "val_learned_changed_fraction": 0.3541666666666667,
      "val_learned_avg_edits": 0.4791666666666667,
      "val_learned_oracle_gap_recovered": 0.17391304347826084
    },
    {
      "epoch": 8,
      "stage": "full",
      "stage_epoch": 6,
      "stage_topk": 3,
      "stage_max_edits": 2,
      "stage_max_pair_arg_slots": 24,
      "train_loss": 1.8750338455402016,
      "val_n": 48.0,
      "val_oracle_found_fraction": 0.8541666666666666,
      "val_avg_candidates": 1299.0,
      "val_avg_positive_candidates": 1.1875,
      "val_base_executor_accuracy": 0.375,
      "val_base_program_exact": 0.375,
      "val_base_state_prefix_fraction": 0.5885416666666665,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.375,
      "val_prior_program_exact": 0.375,
      "val_prior_state_prefix_fraction": 0.5885416666666665,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.19704861111111105,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.6458333333333333,
      "val_oracle_executor_accuracy": 0.8541666666666666,
      "val_oracle_program_exact": 0.8541666666666666,
      "val_oracle_state_prefix_fraction": 0.888888888888889,
      "val_oracle_changed_fraction": 0.4791666666666667,
      "val_oracle_avg_edits": 0.7291666666666666,
      "val_learned_executor_accuracy": 0.3958333333333333,
      "val_learned_program_exact": 0.3958333333333333,
      "val_learned_state_prefix_fraction": 0.670138888888889,
      "val_learned_changed_fraction": 0.5625,
      "val_learned_avg_edits": 0.5833333333333334,
      "val_learned_oracle_gap_recovered": 0.04347826086956518
    }
  ]
}