{
  "metadata": {
    "python": "3.12.3",
    "platform": "Linux-6.8.0-62-generic-x86_64-with-glibc2.39",
    "torch": "2.8.0+cu128",
    "cuda_available": true,
    "gpu_name": "NVIDIA RTX 6000 Ada Generation",
    "args": {
      "run_name": "smoke_progressive_repair",
      "compiler_checkpoint": "large_artifacts/qwen_progressive_repair_compiler/checkpoints/fixed_compiler_step00800",
      "train_examples": 8,
      "val_examples": 4,
      "eval_examples": 4,
      "eval_pairs": 4,
      "train_length": 24,
      "eval_length": 24,
      "train_template_modes": "standard,paraphrase",
      "repair_topk": 2,
      "repair_max_edits": 1,
      "repair_max_pair_arg_slots": 4,
      "candidate_curriculum": "tiny:2:1:4:1,full:2:1:4:1",
      "qwen_batch_size": 2,
      "max_length": 384,
      "trace_d_model": 32,
      "trace_layers": 1,
      "trace_heads": 4,
      "trace_ff_mult": 2,
      "verifier_dropout": 0.05,
      "verifier_epochs": 2,
      "verifier_lr": 0.001,
      "verifier_weight_decay": 0.0001,
      "no_positive_base_weight": 0.2,
      "grad_clip": 1.0,
      "pair_top_m": 25,
      "pair_bonus": 2.0,
      "seed": 31,
      "eval_seed": 33001
    },
    "compiler_args": {
      "model_id": "Qwen/Qwen3-4B",
      "modulus": 97,
      "max_steps": 24,
      "head_width": 768,
      "rank_temperature": 1.0,
      "arg_reader_mode": "after_op",
      "arg_window": 8,
      "arg_distance_temperature": 2.0
    },
    "feature_names": [
      "bias",
      "candidate_prior",
      "prior_delta",
      "candidate_prior_per_slot",
      "prior_delta_per_edit",
      "base_prior",
      "edit_count",
      "changed",
      "init_edit",
      "op_edit_count",
      "arg_edit_count",
      "edit_fraction",
      "first_edit_pos_norm",
      "last_edit_pos_norm",
      "mean_edit_pos_norm",
      "edit_span_norm",
      "mean_new_rank",
      "max_new_rank",
      "mean_changed_margin",
      "min_changed_margin",
      "mean_changed_entropy",
      "mean_logp_delta",
      "min_logp_delta",
      "max_logp_delta",
      "base_init_margin",
      "base_op_margin_mean",
      "base_op_margin_min",
      "base_arg_margin_mean",
      "base_arg_margin_min",
      "base_op_entropy_mean",
      "base_arg_entropy_mean",
      "candidate_answer_norm",
      "candidate_final_soft_logp",
      "candidate_state_soft_logp_mean",
      "candidate_state_soft_logp_min",
      "base_final_soft_logp",
      "base_state_soft_logp_mean",
      "answer_equals_base",
      "state_same_fraction_as_base",
      "state_prefix_same_as_base",
      "mean_old_value_norm",
      "mean_new_value_norm",
      "mean_abs_value_delta_norm",
      "arg_new_value_mean_norm",
      "arg_abs_delta_mean_norm",
      "op_new_add_frac",
      "op_new_sub_frac",
      "op_new_mul_frac",
      "candidate_add_frac",
      "candidate_sub_frac",
      "candidate_mul_frac",
      "candidate_arg_mean_norm",
      "candidate_arg_std_norm",
      "base_add_frac",
      "base_sub_frac",
      "base_mul_frac"
    ],
    "trace_feature_names": [
      "is_global",
      "is_step",
      "active",
      "step_pos_norm",
      "candidate_prior",
      "prior_delta",
      "edit_count",
      "init_value_norm",
      "init_changed",
      "answer_norm",
      "final_soft_logp",
      "base_final_soft_logp",
      "answer_equals_base",
      "op_add",
      "op_sub",
      "op_mul",
      "arg_norm",
      "state_norm",
      "state_soft_logp",
      "base_op_add",
      "base_op_sub",
      "base_op_mul",
      "base_arg_norm",
      "base_state_norm",
      "base_state_soft_logp",
      "op_changed",
      "arg_changed",
      "state_same_as_base",
      "op_logp",
      "arg_logp",
      "op_logp_delta",
      "arg_logp_delta",
      "op_margin",
      "arg_margin",
      "op_entropy",
      "arg_entropy"
    ],
    "candidate_curriculum_stages": [
      {
        "name": "tiny",
        "topk": 2,
        "max_edits": 1,
        "max_pair_arg_slots": 4,
        "epochs": 1
      },
      {
        "name": "full",
        "topk": 2,
        "max_edits": 1,
        "max_pair_arg_slots": 4,
        "epochs": 1
      }
    ],
    "train_seconds": 10.064210176467896
  },
  "metrics": {
    "train_len24": {
      "n": 8.0,
      "oracle_found_fraction": 0.625,
      "avg_candidates": 50.0,
      "avg_positive_candidates": 0.625,
      "base_executor_accuracy": 0.5,
      "base_program_exact": 0.5,
      "base_state_prefix_fraction": 0.765625,
      "base_changed_fraction": 0.0,
      "base_avg_edits": 0.0,
      "prior_executor_accuracy": 0.5,
      "prior_program_exact": 0.5,
      "prior_state_prefix_fraction": 0.765625,
      "prior_changed_fraction": 0.0,
      "prior_avg_edits": 0.0,
      "soft_trace_executor_accuracy": 0.0,
      "soft_trace_program_exact": 0.0,
      "soft_trace_state_prefix_fraction": 0.27604166666666663,
      "soft_trace_changed_fraction": 1.0,
      "soft_trace_avg_edits": 1.0,
      "oracle_executor_accuracy": 0.625,
      "oracle_program_exact": 0.625,
      "oracle_state_prefix_fraction": 0.7708333333333334,
      "oracle_changed_fraction": 0.125,
      "oracle_avg_edits": 0.125,
      "learned_executor_accuracy": 0.5,
      "learned_program_exact": 0.5,
      "learned_state_prefix_fraction": 0.765625,
      "learned_changed_fraction": 0.0,
      "learned_avg_edits": 0.0,
      "learned_oracle_gap_recovered": 0.0
    },
    "val_len24": {
      "n": 4.0,
      "oracle_found_fraction": 0.0,
      "avg_candidates": 50.0,
      "avg_positive_candidates": 0.0,
      "base_executor_accuracy": 0.0,
      "base_program_exact": 0.0,
      "base_state_prefix_fraction": 0.3645833333333333,
      "base_changed_fraction": 0.0,
      "base_avg_edits": 0.0,
      "prior_executor_accuracy": 0.0,
      "prior_program_exact": 0.0,
      "prior_state_prefix_fraction": 0.3645833333333333,
      "prior_changed_fraction": 0.0,
      "prior_avg_edits": 0.0,
      "soft_trace_executor_accuracy": 0.0,
      "soft_trace_program_exact": 0.0,
      "soft_trace_state_prefix_fraction": 0.19791666666666669,
      "soft_trace_changed_fraction": 1.0,
      "soft_trace_avg_edits": 1.0,
      "oracle_executor_accuracy": 0.0,
      "oracle_program_exact": 0.0,
      "oracle_state_prefix_fraction": 0.3645833333333333,
      "oracle_changed_fraction": 0.0,
      "oracle_avg_edits": 0.0,
      "learned_executor_accuracy": 0.0,
      "learned_program_exact": 0.0,
      "learned_state_prefix_fraction": 0.3645833333333333,
      "learned_changed_fraction": 0.0,
      "learned_avg_edits": 0.0,
      "learned_oracle_gap_recovered": NaN
    },
    "fresh_standard_len24": {
      "n": 4.0,
      "oracle_found_fraction": 0.0,
      "avg_candidates": 50.0,
      "avg_positive_candidates": 0.0,
      "base_executor_accuracy": 0.0,
      "base_program_exact": 0.0,
      "base_state_prefix_fraction": 0.19791666666666666,
      "base_changed_fraction": 0.0,
      "base_avg_edits": 0.0,
      "prior_executor_accuracy": 0.0,
      "prior_program_exact": 0.0,
      "prior_state_prefix_fraction": 0.19791666666666666,
      "prior_changed_fraction": 0.0,
      "prior_avg_edits": 0.0,
      "soft_trace_executor_accuracy": 0.0,
      "soft_trace_program_exact": 0.0,
      "soft_trace_state_prefix_fraction": 0.1875,
      "soft_trace_changed_fraction": 1.0,
      "soft_trace_avg_edits": 1.0,
      "oracle_executor_accuracy": 0.0,
      "oracle_program_exact": 0.0,
      "oracle_state_prefix_fraction": 0.19791666666666666,
      "oracle_changed_fraction": 0.0,
      "oracle_avg_edits": 0.0,
      "learned_executor_accuracy": 0.0,
      "learned_program_exact": 0.0,
      "learned_state_prefix_fraction": 0.19791666666666666,
      "learned_changed_fraction": 0.0,
      "learned_avg_edits": 0.0,
      "learned_oracle_gap_recovered": NaN
    },
    "fresh_paraphrase_len24": {
      "n": 4.0,
      "oracle_found_fraction": 0.25,
      "avg_candidates": 50.0,
      "avg_positive_candidates": 0.25,
      "base_executor_accuracy": 0.0,
      "base_program_exact": 0.0,
      "base_state_prefix_fraction": 0.5729166666666666,
      "base_changed_fraction": 0.0,
      "base_avg_edits": 0.0,
      "prior_executor_accuracy": 0.0,
      "prior_program_exact": 0.0,
      "prior_state_prefix_fraction": 0.5729166666666666,
      "prior_changed_fraction": 0.0,
      "prior_avg_edits": 0.0,
      "soft_trace_executor_accuracy": 0.0,
      "soft_trace_program_exact": 0.0,
      "soft_trace_state_prefix_fraction": 0.34374999999999994,
      "soft_trace_changed_fraction": 1.0,
      "soft_trace_avg_edits": 1.0,
      "oracle_executor_accuracy": 0.25,
      "oracle_program_exact": 0.25,
      "oracle_state_prefix_fraction": 0.59375,
      "oracle_changed_fraction": 0.25,
      "oracle_avg_edits": 0.25,
      "learned_executor_accuracy": 0.0,
      "learned_program_exact": 0.0,
      "learned_state_prefix_fraction": 0.5729166666666666,
      "learned_changed_fraction": 0.0,
      "learned_avg_edits": 0.0,
      "learned_oracle_gap_recovered": 0.0
    },
    "fresh_paired_len24": {
      "n": 8.0,
      "oracle_found_fraction": 0.0,
      "avg_candidates": 50.0,
      "avg_positive_candidates": 0.0,
      "base_executor_accuracy": 0.0,
      "base_program_exact": 0.0,
      "base_state_prefix_fraction": 0.41666666666666663,
      "base_changed_fraction": 0.0,
      "base_avg_edits": 0.0,
      "prior_executor_accuracy": 0.0,
      "prior_program_exact": 0.0,
      "prior_state_prefix_fraction": 0.41666666666666663,
      "prior_changed_fraction": 0.0,
      "prior_avg_edits": 0.0,
      "soft_trace_executor_accuracy": 0.0,
      "soft_trace_program_exact": 0.0,
      "soft_trace_state_prefix_fraction": 0.25,
      "soft_trace_changed_fraction": 1.0,
      "soft_trace_avg_edits": 1.0,
      "oracle_executor_accuracy": 0.0,
      "oracle_program_exact": 0.0,
      "oracle_state_prefix_fraction": 0.41666666666666663,
      "oracle_changed_fraction": 0.0,
      "oracle_avg_edits": 0.0,
      "learned_executor_accuracy": 0.0,
      "learned_program_exact": 0.0,
      "learned_state_prefix_fraction": 0.41666666666666663,
      "learned_changed_fraction": 0.0,
      "learned_avg_edits": 0.0,
      "learned_oracle_gap_recovered": NaN,
      "pair_rerank_executor_accuracy": 0.0,
      "pair_rerank_program_exact": 0.0,
      "pair_rerank_state_prefix_fraction": 0.41666666666666663,
      "pair_rerank_changed_fraction": 0.0,
      "pair_rerank_avg_edits": 0.0,
      "learned_pair_answer_consistency": 1.0,
      "learned_pair_both_correct": 0.0,
      "learned_pair_program_consistency": 1.0,
      "learned_pair_state_consistency": 1.0,
      "pair_rerank_pair_answer_consistency": 1.0,
      "pair_rerank_pair_both_correct": 0.0,
      "pair_rerank_pair_program_consistency": 1.0,
      "pair_rerank_pair_state_consistency": 1.0,
      "oracle_pair_answer_consistency": 1.0,
      "oracle_pair_both_correct": 0.0,
      "oracle_pair_program_consistency": 1.0,
      "oracle_pair_state_consistency": 1.0,
      "base_pair_answer_consistency": 1.0,
      "base_pair_both_correct": 0.0,
      "base_pair_program_consistency": 1.0,
      "base_pair_state_consistency": 1.0
    }
  },
  "train_log": [
    {
      "epoch": 1,
      "stage": "tiny",
      "stage_epoch": 1,
      "stage_topk": 2,
      "stage_max_edits": 1,
      "stage_max_pair_arg_slots": 4,
      "train_loss": 2.255711153149605,
      "val_n": 4.0,
      "val_oracle_found_fraction": 0.0,
      "val_avg_candidates": 50.0,
      "val_avg_positive_candidates": 0.0,
      "val_base_executor_accuracy": 0.0,
      "val_base_program_exact": 0.0,
      "val_base_state_prefix_fraction": 0.3645833333333333,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.0,
      "val_prior_program_exact": 0.0,
      "val_prior_state_prefix_fraction": 0.3645833333333333,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.19791666666666669,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.0,
      "val_oracle_executor_accuracy": 0.0,
      "val_oracle_program_exact": 0.0,
      "val_oracle_state_prefix_fraction": 0.3645833333333333,
      "val_oracle_changed_fraction": 0.0,
      "val_oracle_avg_edits": 0.0,
      "val_learned_executor_accuracy": 0.0,
      "val_learned_program_exact": 0.0,
      "val_learned_state_prefix_fraction": 0.3645833333333333,
      "val_learned_changed_fraction": 0.0,
      "val_learned_avg_edits": 0.0,
      "val_learned_oracle_gap_recovered": NaN
    },
    {
      "epoch": 2,
      "stage": "full",
      "stage_epoch": 1,
      "stage_topk": 2,
      "stage_max_edits": 1,
      "stage_max_pair_arg_slots": 4,
      "train_loss": 1.576295379549265,
      "val_n": 4.0,
      "val_oracle_found_fraction": 0.0,
      "val_avg_candidates": 50.0,
      "val_avg_positive_candidates": 0.0,
      "val_base_executor_accuracy": 0.0,
      "val_base_program_exact": 0.0,
      "val_base_state_prefix_fraction": 0.3645833333333333,
      "val_base_changed_fraction": 0.0,
      "val_base_avg_edits": 0.0,
      "val_prior_executor_accuracy": 0.0,
      "val_prior_program_exact": 0.0,
      "val_prior_state_prefix_fraction": 0.3645833333333333,
      "val_prior_changed_fraction": 0.0,
      "val_prior_avg_edits": 0.0,
      "val_soft_trace_executor_accuracy": 0.0,
      "val_soft_trace_program_exact": 0.0,
      "val_soft_trace_state_prefix_fraction": 0.19791666666666669,
      "val_soft_trace_changed_fraction": 1.0,
      "val_soft_trace_avg_edits": 1.0,
      "val_oracle_executor_accuracy": 0.0,
      "val_oracle_program_exact": 0.0,
      "val_oracle_state_prefix_fraction": 0.3645833333333333,
      "val_oracle_changed_fraction": 0.0,
      "val_oracle_avg_edits": 0.0,
      "val_learned_executor_accuracy": 0.0,
      "val_learned_program_exact": 0.0,
      "val_learned_state_prefix_fraction": 0.3645833333333333,
      "val_learned_changed_fraction": 0.0,
      "val_learned_avg_edits": 0.0,
      "val_learned_oracle_gap_recovered": NaN
    }
  ]
}