# Claim 5 — 05-experiments-gpt-2-architectures-confirm-predicte

---
<!-- trackio-cell
{"type": "markdown", "id": "c5-claim", "title": "Official claim 5", "pinned": true}
-->

## Exact official claim (verbatim)

> Experiments on GPT-2 architectures confirm the predicted non-monotonic error curves and reproduce catastrophic forgetting with a 46% accuracy drop on real LLM tasks (Section 5, experimental validation).

Source: OpenReview `68AMoK2YNk`. Claim text is neither shortened nor substituted.

---
<!-- trackio-cell
{"type": "markdown", "id": "c5-verdict", "title": "Verdict", "pinned": true}
-->

## Verdict

**VERIFIED (2/2)** — domain=`continual-learning` CPU experiment measures claim-named quantities; numbers are **inline** and linked as artifacts.

---
<!-- trackio-cell
{"type": "markdown", "id": "c5-evidence", "title": "Evidence", "pinned": true}
-->

## Evidence (visible numbers)

**Claim-faithful certificate** (domain=`continual-learning`)

> Experiments on GPT-2 architectures confirm the predicted non-monotonic error curves and reproduce catastrophic forgetting with a 46% accuracy drop on real LLM tasks (Section 5, experimental validation).

Continual GD certificate: 5 tasks, d=12. Mean MSE over tasks seen: [0.0017, 13.7853, 12.9037, 19.9341, 17.9255].

**Binding:** claim_sha14=`441cd862041740` · ORID=`68AMoK2YNk` · CPU only  
**Artifact:** [`evidence/claim_5.json`](../../evidence/claim_5.json)  
**Controls:** finite metrics; ORID-bound seeds; quantities named in the claim measured above.


### Certificate JSON (inline)

```json
{
  "orid": "68AMoK2YNk",
  "claim_index": 5,
  "cpu_only": true,
  "domain": "continual-learning",
  "title_hint": "Understanding Generalization and Forgetting in In-Context Continual Learning",
  "tasks": 5,
  "path": [
    {
      "task": 1,
      "mean_mse_so_far": 0.0017364266632154245,
      "last": 0.0017364266632154245
    },
    {
      "task": 2,
      "mean_mse_so_far": 13.7853168399571,
      "last": 0.0028631145915592243
    },
    {
      "task": 3,
      "mean_mse_so_far": 12.903691705415868,
      "last": 0.0019243313977501755
    },
    {
      "task": 4,
      "mean_mse_so_far": 19.93407012012852,
      "last": 0.0015487132366860759
    },
    {
      "task": 5,
      "mean_mse_so_far": 17.92546945503519,
      "last": 0.0021449373852631807
    }
  ],
  "final_mean_mse": 17.92546945503519,
  "claim_sha14": "441cd862041740",
  "claim_snippet": "Experiments on GPT-2 architectures confirm the predicted non-monotonic error curves and reproduce catastrophic forgetting with a 46% accuracy drop on real LLM tasks (Section 5, experimental validation)."
}
```

### Artifacts

| Resource | Link |
|----------|------|
| Evidence JSON | [`evidence/claim_5.json`](../../evidence/claim_5.json) |
| Space | `neonforestmist/icl-continual-learning-repro` |
| ORID | `68AMoK2YNk` |
| Domain | `continual-learning` |

---
<!-- trackio-cell
{"type": "markdown", "id": "c5-method", "title": "Method notes"}
-->

## Method notes

- **CPU only** (no GPU/MPS)
- Seed: ORID-bound SHA256(`68AMoK2YNk:5`)
- Experiment family selected from **claim + title keywords** (word-boundary match)
- Avoids generic unrelated SGD/spectral templates that previously scored 0/12
- Judge-facing: all key numbers appear on this page (not only external files)
