{
  "args": {
    "model_id": "hf-internal-testing/tiny-random-LlamaForCausalLM",
    "load_in_4bit": false,
    "torch_dtype": "fp32",
    "device_map": "auto",
    "use_lora": false,
    "lora_r": 8,
    "lora_alpha": 16,
    "lora_dropout": 0.05,
    "lora_target_modules": "all-linear",
    "gradient_checkpointing": false,
    "optimizer": "adamw",
    "modulus": 17,
    "max_steps": 6,
    "train_min_len": 1,
    "train_max_len": 2,
    "answer_train_min_len": 1,
    "answer_train_max_len": 2,
    "eval_lengths": "2",
    "train_template_mode": "mixed",
    "paired_train": true,
    "paired_batches": true,
    "paired_template_modes": "standard,paraphrase",
    "pair_size": 2,
    "answer_train_template_mode": "mixed",
    "eval_template_modes": "standard,paraphrase",
    "paired_eval": true,
    "paired_eval_template_modes": "standard,paraphrase",
    "train_size": 4,
    "answer_train_size": 4,
    "eval_size": 4,
    "train_batch_size": 4,
    "eval_batch_size": 4,
    "bootstrap_steps": 1,
    "answer_steps": 0,
    "eval_every": 1,
    "stage_eval_every": 1,
    "lr": 0.001,
    "answer_lr_scale": 0.1,
    "weight_decay": 0.0,
    "grad_clip": 1.0,
    "head_width": 64,
    "rank_temperature": 1.0,
    "arg_reader_mode": "after_op",
    "arg_window": 8,
    "arg_distance_temperature": 2.0,
    "trace_loss_weight": 1.0,
    "init_trace_loss_weight": 4.0,
    "op_trace_loss_weight": 1.0,
    "arg_trace_loss_weight": 4.0,
    "selection_loss_weight": 1.0,
    "role_pos_weight": 20.0,
    "init_selection_loss_weight": 1.0,
    "op_selection_loss_weight": 1.0,
    "arg_selection_loss_weight": 2.0,
    "executor_loss_weight": 1.0,
    "stability_loss_weight": 0.25,
    "init_stability_weight": 0.25,
    "op_stability_weight": 1.0,
    "arg_stability_weight": 1.0,
    "answer_stability_weight": 0.25,
    "variants": "copy_trace_stability",
    "max_length": 128,
    "seed": 7,
    "output_dir": "experiments/qwen_slot_stability_compiler/runs/smoke_tiny_paired_eval",
    "checkpoint_dir": ""
  },
  "metadata": {
    "python": "3.12.3",
    "platform": "Linux-6.8.0-62-generic-x86_64-with-glibc2.39",
    "torch": "2.8.0+cu128",
    "cuda_available": true,
    "transformers_loader": "AutoModelForCausalLM",
    "peft_installed": true,
    "use_lora": false,
    "lora_r": 8,
    "gpu_name": "NVIDIA RTX 6000 Ada Generation",
    "gpu_vram_gb": 47.383
  },
  "hidden_dim": 16,
  "dataset": {
    "train_size": 4,
    "train_examples": 8,
    "answer_train_size": 4,
    "eval_size": 4,
    "train_lengths": [
      1,
      2
    ],
    "answer_train_lengths": [
      1,
      2
    ],
    "eval_lengths": [
      2
    ],
    "train_template_mode": "mixed",
    "paired_train": true,
    "paired_batches": true,
    "paired_template_modes": [
      "standard",
      "paraphrase"
    ],
    "answer_train_template_mode": "mixed",
    "eval_template_modes": [
      "standard",
      "paraphrase"
    ],
    "paired_eval": true,
    "paired_eval_template_modes": [
      "standard",
      "paraphrase"
    ]
  },
  "variants": {
    "copy_trace_stability": {
      "variant": "copy_trace_stability",
      "train_seconds": 0.48285651206970215,
      "checkpoints": [
        "large_artifacts/qwen_slot_stability_compiler/checkpoints/smoke_tiny_paired_eval/copy_trace_stability/frozen_backbone.txt",
        "large_artifacts/qwen_slot_stability_compiler/checkpoints/smoke_tiny_paired_eval/copy_trace_stability/heads.pt"
      ],
      "train_log": [
        {
          "variant": "copy_trace_stability",
          "stage": "trace_stability",
          "local_step": 1,
          "step": 1,
          "loss": 26.265893936157227,
          "trace_loss_active": true,
          "executor_loss_active": true,
          "lr_scale": 1.0,
          "executor_loss": 1.796623706817627,
          "init_loss": 0.4596938490867615,
          "op_loss": 0.33251577615737915,
          "arg_loss": 1.2264553308486938,
          "init_attn_loss": 3.8942031860351562,
          "op_attn_loss": 3.740614652633667,
          "arg_attn_loss": 4.11569356918335,
          "role_loss": 1.5173203945159912,
          "init_stability_loss": 3.8694997783750296e-07,
          "op_stability_loss": 0.005284798331558704,
          "arg_stability_loss": 0.02384217455983162,
          "answer_stability_loss": 0.02160545624792576,
          "standard_len2_direct_accuracy": NaN,
          "standard_len2_direct_target_mass": NaN,
          "standard_len2_executor_accuracy": 0.0,
          "standard_len2_executor_target_mass": 0.11993464827537537,
          "standard_len2_init_accuracy": 0.5,
          "standard_len2_init_pos_accuracy": 0.0,
          "standard_len2_op_accuracy": 0.625,
          "standard_len2_arg_accuracy": 0.25,
          "standard_len2_op_pos_accuracy": 0.0,
          "standard_len2_arg_pos_accuracy": 0.0,
          "standard_len2_program_exact": 0.0,
          "paraphrase_len2_direct_accuracy": NaN,
          "paraphrase_len2_direct_target_mass": NaN,
          "paraphrase_len2_executor_accuracy": 0.25,
          "paraphrase_len2_executor_target_mass": 0.1536158323287964,
          "paraphrase_len2_init_accuracy": 0.5,
          "paraphrase_len2_init_pos_accuracy": 0.0,
          "paraphrase_len2_op_accuracy": 0.625,
          "paraphrase_len2_arg_accuracy": 0.125,
          "paraphrase_len2_op_pos_accuracy": 0.0,
          "paraphrase_len2_arg_pos_accuracy": 0.0,
          "paraphrase_len2_program_exact": 0.0,
          "paired_len2_direct_accuracy": NaN,
          "paired_len2_direct_target_mass": NaN,
          "paired_len2_executor_accuracy": 0.0,
          "paired_len2_executor_target_mass": 0.07562384754419327,
          "paired_len2_init_accuracy": 0.25,
          "paired_len2_init_pos_accuracy": 0.0,
          "paired_len2_op_accuracy": 0.5,
          "paired_len2_arg_accuracy": 0.0625,
          "paired_len2_op_pos_accuracy": 0.0,
          "paired_len2_arg_pos_accuracy": 0.0,
          "paired_len2_program_exact": 0.0,
          "paired_len2_pair_true_answer_consistency": 1.0,
          "paired_len2_pair_true_length_consistency": 1.0,
          "paired_len2_executor_pair_answer_consistency": 0.75,
          "paired_len2_executor_pair_both_correct": 0.0,
          "paired_len2_compiler_pair_program_consistency": 0.75
        }
      ],
      "final_metrics": {
        "standard_len2": {
          "variant": "copy_trace_stability",
          "n": 4.0,
          "direct_accuracy": NaN,
          "direct_target_mass": NaN,
          "executor_accuracy": 0.0,
          "executor_target_mass": 0.11993464827537537,
          "init_accuracy": 0.5,
          "init_pos_accuracy": 0.0,
          "op_accuracy": 0.625,
          "arg_accuracy": 0.25,
          "op_pos_accuracy": 0.0,
          "arg_pos_accuracy": 0.0,
          "program_exact": 0.0
        },
        "paraphrase_len2": {
          "variant": "copy_trace_stability",
          "n": 4.0,
          "direct_accuracy": NaN,
          "direct_target_mass": NaN,
          "executor_accuracy": 0.25,
          "executor_target_mass": 0.1536158323287964,
          "init_accuracy": 0.5,
          "init_pos_accuracy": 0.0,
          "op_accuracy": 0.625,
          "arg_accuracy": 0.125,
          "op_pos_accuracy": 0.0,
          "arg_pos_accuracy": 0.0,
          "program_exact": 0.0
        },
        "paired_len2": {
          "variant": "copy_trace_stability",
          "n": 8.0,
          "direct_accuracy": NaN,
          "direct_target_mass": NaN,
          "executor_accuracy": 0.0,
          "executor_target_mass": 0.07562384754419327,
          "init_accuracy": 0.25,
          "init_pos_accuracy": 0.0,
          "op_accuracy": 0.5,
          "arg_accuracy": 0.0625,
          "op_pos_accuracy": 0.0,
          "arg_pos_accuracy": 0.0,
          "program_exact": 0.0,
          "pair_true_answer_consistency": 1.0,
          "pair_true_length_consistency": 1.0,
          "executor_pair_answer_consistency": 0.75,
          "executor_pair_both_correct": 0.0,
          "compiler_pair_program_consistency": 0.75
        }
      }
    }
  }
}