두 핵심 게이트는 아직 통과하지 못했습니다. G1(DEQ 수렴·변별)과 G2(디코더 기여) 모두 미통과입니다.
9월에는 두 축의 원인을 좁혔고, 그 과정에서 수렴 척도와 채점기의 결함을 발견했습니다. 다음 실험 전에 평가·채점·계산 도구를 한 벌로 고정하고, 지난 결과를 재현·재채점하는 다섯 가지 점검을 마쳤습니다. 다섯 항목 모두 재현됐습니다.
점검 직후 사전등록된 첫 개입 실험(라우팅 마스크 동결, 74문항)을 시작했고, 현재 진행 중입니다. 이후 디코더 학습 → 미열람 520문항 확증 → 600문항 평가 순으로 진행해 게이트를 판정합니다.
| 게이트 | 기준 | 현재 | 상태 |
|---|---|---|---|
| G1 DEQ 수렴·변별 | 참 잔차 r<1e-2 비율: 학습 ≥95%, held-out ≥90% | S5 기준 학습 85.9%, held-out 88.75%. S7 400문항 최종점 87.3% | 미통과 |
| G2 디코더 기여 | 문제 글 + z* 디코더가 글만·z_src보다 우월(게이트 2∧3∧4) | z*만 넣는 방식은 학습 문항에서도 2/40, 재채점 후 strict 1/640 → 폐기. 문제 글 + z* 방식 학습 대기 | 미통과 |
rho@2000은 1,000걸음 실행에서 마지막 값의 복사본이었습니다(400/400 동일). → 사용을 금지했습니다.2\sqrt{3}을 2로 처리, "3.5."를 3으로 처리).서버 원본 경로 기준. 수치는 각 로그의 실측값입니다.
| 점검 | 내용 | 결과 | 근거 |
|---|---|---|---|
| V1 | Phase 2 디코더 평가 재현(held-out 80) | matched 80/80, shuffled 80/80 출력 동일 | raw_instrument/v1_eval80.log |
| V2 | Phase 2 640건 재채점(채점기 v2) | strict 5→1, lenient 24→6 | raw_instrument/v2_rescore_20260930_2349.json |
| V3 | 정본 앵커 20문항 GPU 재계산 | 20/20 max|Δ| = 0, cos = 1.0 | raw_instrument/v3_anchor20_rerun.log |
| V4 | Anderson 참조 풀이기·마스크 동결 경로 | 선형 수축 시험 r₂₀ = 1.1e-11, torchdeq와 반복별 차이 0 | raw_s7/unit_anderson_TASK0002.log |
| V5 | z* 저장 구조 | rho@2000 = rho@1000 400/400, z_1000 키 없음(최종점이 곧 z_star) | results_s7/zstar_s7_a0.25_400.pt |
| 도구 고정 | 평가·채점·계산 원본 10종을 instrument/로 격리 | 원본과 SHA 10/10 일치 | instrument/MANIFEST.sha256 |
| 일괄 점검 | check_scale.sh 7항목(202초) | 6 통과, [4] 앵커 테스트 1건 미통과 | raw_instrument/check_20261001_0156.log |
[4] 미통과는 V3(같은 앵커 20/20 일치)와 상충합니다. 테스트가 다른 설정(α=0.5)으로 만든 기준 파일과 비교하는 것으로 보여, 테스트를 고쳐 통과시키지 않고 기준 파일의 타당성을 감사 중입니다. 결과는 별도로 알려드리겠습니다.
| 단계 | 내용 | 예상 소요 | 상태 |
|---|---|---|---|
| P0 | 환경·도구 SHA 점검 | — | 일치 |
| P1·P2 | r_1000 재평가, 새 실행기 동등성, 판별력 있는 동결 검증 | 약 2시간 | 실행 보고, 감사 대기 |
| P3 | 개입 실험: 300걸음 뒤 top-3 라우팅 동결 → Anderson, 미수렴 54 + 대조 20 | 약 70분 | 진행 중 |
| P4 | z_src 계산, 디코더 학습 A(z*)·D(마진 없음)·E(z_src) | 수 시간 | 대기 |
| P5 | 미열람 held-out 520 확증 계산(1회) | 약 18시간 | 대기 |
| P6 | 600문항 생성·채점, 게이트 2·3·4 판정 | 약 25시간 | 대기 |
P3 중간 수치(26/74 시점, 판정 아님): 미수렴 26문항 중 25문항이 동결 후 r<1e-3에 도달했습니다. 대조 문항 사전 시험의 코사인은 0.99984(기준 ≥0.9990)입니다. 최종 판정에는 게이트 수치와 함께 자기 일관 비율을 봅니다. 동결해서 찾은 점에서 라우팅을 다시 계산해도 같은 마스크가 나오는 비율로, 동결로 찾은 점이 원래 DEQ의 고정점인지를 가리는 지표입니다.
판정 원칙. 이미 본 자료(400·학습 680)의 개선 수치는 확증 근거로 쓰지 않습니다. G1 승격과 G2 판정은 아직 아무도 보지 않은 held-out 520에서 한 번만 합니다.
90cc93e4…)를 고정했습니다. 별도 브랜치의 채점기(bd25bfd4…)를 쓰려면 사전등록 개정이 필요해, 현재는 v2를 유지합니다.| 항목 | SHA-256 |
|---|---|
| PREREG_S7_DEQ_v1.2 (잠금본) | 809a88be0be18e1eec2119d0e17b88dc8eb0c00b326c71ccfc88376c63bd4014 |
| PREREG_S7_D_v3_5 (잠금본) | 5d7e32aa1edfebf7611f0f16769ebb344433e8ca3a554b7321d7e0979d9600ed |
| 정본 풀이기 zstar_canonical.py | b7170aeb68833448c8bb0977eb7ac035ef06614c9a5edf2f228448c2bb96d45d |
| 전이 함수 transition_inject.py | 127068435ec561c36a5e8a5e2e208763b80e53a70853ab50528ede7f84f2997c |
| Anderson 참조 풀이기 | 06c93011058b9dfa83e1846636fa05ae65a117b49d9b35045ba8a59e2a49d7e3 |
| 채점기 v2 | 90cc93e4b76704b209291ac43999a3f829ac79f7234c60362f95bccadd12fa13 |
| Phase 2 재채점 결과 | 2b4f81221273e9c35e2af41be3d5ded4d2033dead268fa3fe7a6228b72430117 |
| S7 z* 400문항 / 학습 680문항 (정지 플래그 기록) | bbe7ad3b… / 4f659e78… |
| 사전등록·감사 기록 묶음 (cts_handoff_20261001.zip) | 00ec37e49051bc194bf5523c09c9cb9cc0160397c048bad1534d2beef1c53904 |
로그 원본은 연구실 서버 /home/shoon/cts_e1_s5/의 raw_s7/, raw_instrument/에 있습니다. 요청하시면 압축해 보내드리겠습니다.