Lewati ke isi

Analisis Kesenjangan Riset (Candidate-Gap Batch 1)

Status Halaman: CANDIDATE-GAP DIKUNCI (GATE 2, 2026-09-10)

Sintesis 5C Batch 1 tuntas dan terverifikasi: 475 klaim angka diaudit silang ke DEF CSV + L2 JSON + teks primer (472 PASS, 3 MISMATCH diperbaiki, residual nol — bukti: 02_slr/synthesis/VERIFICATION-5C.md, rincian VERIFICATION-5C-A.md + VERIFICATION-5C-B.md). Delapan kesenjangan di bawah berstatus candidate-gap (BUKAN final-gap): tiap gap berpola lintas ≥2 paper + tradeoff berangka + DOI, dengan syarat naik ke final tertulis. Final-gap menunggu Batch 2 (portal kampus IEEE/ACM/Scopus) + Batch 3 (snowballing).

Fokus sintesis terkunci: selective HITL approval gate yang meminimalisir intervensi manusia (amendment 00_meta/amendment_I_selective_20260910.md, bobot G3 40 / G1 25 / G2 20 / G4+G5 15). PICOC v1 00_meta/protocol_slr.md tetap LOCKED komposit.


GAP-01 — Drop-Off Gerbang Statis vs Gerbang Selektif Berisiko (empirical)

  • Tradeoff inti: S08 (Atlassian JIRA, gerbang ganda wajib) hanya 56/663 tiket lolos merge — yield 8,4%, drop-off end-to-end 91,55% [FAKTA-DOK papers/B1-060.txt Fig 4; DOI: 10.1109/icse-seip66354.2025.00036]. S01 (risk-proportionate gate, ambang ≥0,85) pangkas durasi 18,4→2,5 menit (-87,1%) dengan F1 0,913 pada 120 PR riil [DOI: 10.18535/ijecs/v15i06.5563]. S25 (5 gerbang wajib) andal 100% (6/6) tapi jadi operator mikromanajerial; S46 (shift-left ke kode tes) 0 intervensi kode produksi (10/10).
  • Unfilled: belum ada risk-tiered evaluation + pemisahan hierarkis untuk SE multi-berkas end-to-end (risiko rendah auto-lolos di sandbox, risiko tinggi eskalasi).
  • Syarat final: Batch 2 data intervention rate + reviewer fatigue multi-bahasa; Batch 3 ambang risiko auto-lolos vs eskalasi.
  • Link DEF: S08, S25, S01, S46, S03. Detail: 02_slr/synthesis/GAP-01.md.

GAP-02 — Keselamatan Deterministik vs Penalti Keberhasilan Tugas (methodological)

  • Tradeoff inti: S02 (WoI, aturan L1) tekan CAR ke 0,000 tapi sukses gpt-5.2 turun 0,830→0,734 (-9,6pp, 9 forced abort tanpa eskalasi) [DOI: 10.36227/techrxiv.177205043.39321579/v1]. S03 (regex destruktif) pangkas waktu fitur 91–97% (~1 minggu→~4 jam) tapi macet di migrasi sah (2–3 revisi ADR) [DOI: 10.2139/ssrn.5928934]. S45 (fast-path) 0,005–0,035 ms vs inferensi LLM ~1.500 ms, tapi biner tanpa semantik; S01 (skorer LLM) 2,5 menit tapi F1 0,913.
  • Unfilled: belum ada gerbang hibrida (aturan deterministik <1 ms + eskalasi semantik selektif) — aksi risiko tinggi ditahan dan dimintakan persetujuan, bukan diabort membabi-buta.
  • Syarat final: Batch 2 false-abort-rate industri + kalibrasi hibrida di repo terbuka heterogen.
  • Link DEF: S02, S03, S45, S01. Detail: 02_slr/synthesis/GAP-02.md.

GAP-03 — Pajak Reliabilitas Closed-Loop vs Pipa Deterministik (capacity)

  • Tradeoff inti: S05 (Eco-Evolve) angkat SWE-bench 49,2%→62,3% (+13,1pp) dengan pajak token ~12% (Critic 15% anggaran) [DOI: 10.20944/preprints202603.0129.v1]. S18 tanpa gating: 225 panggilan verifier → 82 (±14) setelah confidence gating (-63,6%), risiko akhir 0,14. S39: kendali-LLM dinamis boros 3,5x token (1,75–2,25M vs 400–700K) dengan akurasi sedikit kalah (0,964 vs 0,969) [DOI: 10.48550/arxiv.2605.09894v1]. S37 patch repair hemat 91,2% vs rewrite penuh, tapi butuh ~5.000 masalah amortisasi cold-start.
  • Unfilled: belum ada budget-aware stopping criteria tersambung ke gerbang selektif (loop lokal ≤2–3 iterasi murah, lalu eskalasi saat jenuh biaya).
  • Syarat final: Batch 2 cost-per-fix loop dibatasi vs tak terbatas di SWE-bench Verified penuh.
  • Link DEF: S05, S18, S39, S37, S10. Detail: 02_slr/synthesis/GAP-03.md.

GAP-04 — Pemulihan Telemetri Lokal vs Gerbang Risiko Sistemik (methodological)

  • Tradeoff inti: S13 (RoleFix) angkat sukses 52,3%→76,1% (+23,8pp), rework 34,2%→11,8% — tapi hanya di ranah wacana agen [DOI: 10.20944/preprints202603.0348.v1]. S02 abort paksa turunkan sukses -9,6pp tanpa mediasi. S45 butuh 6 iterasi kontainer untuk 0%→42,5% paritas (80 tugas); S03 pangkas waktu -96% tapi tiap diff wajib tatap manusia.
  • Unfilled: belum ada perkawinan closed-loop sandbox (sintaksis/linter pulih 100% mandiri) + gerbang selektif (hanya mutasi permanen — migrasi DB, deploy, dependensi inti — naik ke manusia).
  • Syarat final: Batch 2 kuantifikasi reduksi eskalasi + latensi pemulihan otomatis sebelum eskalasi (studi peer-reviewed IEEE/ACM).
  • Link DEF: S02, S45, S13, S03, S01. Detail: 02_slr/synthesis/GAP-04.md.

GAP-05 — Jurang Kualifikasi Industri: 0% Lolos Produksi (capacity)

  • Tradeoff inti: S38 (16 praktisi, 12 perusahaan): 0% mencapai Level 4–5 otonom; 4 enterprise besar blokir 100% rilis produksi (tanpa kualifikasi keselamatan, asimetri informasi) [DOI: 10.48550/arxiv.2605.14675v1]. S08: lokalisasi sempurna runtuh 84%→15% (-69pp), recall 86%→30% di 94 repo industri riil [DOI: 10.1109/icse-seip66354.2025.00036]. S20 klaim HI=0 (99,38% OrganMNIST3D, Dice 0,9041) — tapi terkunci di citra medis tertutup.
  • Unfilled: belum ada arsitektur tata kelola terbukti (sandbox + audit trail + selective gate transparan) sebagai antarmuka kualifikasi keselamatan industri.
  • Syarat final: Batch 2 kriteria penerimaan engineering manager + data reduksi penolakan adopsi (IEEE Software / ACM ESEC-FSE).
  • Link DEF: S38, S08, S20, S01, S03. Detail: 02_slr/synthesis/GAP-05.md.

GAP-06 — Pajak Kompleksitas Percakapan vs Gating Memori (methodological)

  • Tradeoff inti: S35 (1.968 observasi, 164 tugas): tambah agen dialog → inflasi kompleksitas 50–130% (p < 10⁻²³) tanpa gain fungsional (Pass@1 stagnan 84,15–92,07%, ρ negatif) [DOI: 10.48550/arxiv.2606.00308v1]. S19 sebaliknya: Memory Write+Retrieval Gate pangkas token >50% (0,032 vs 0,068) dengan Pass@1 89,84% (matikan gate: -6,25pp) [DOI: 10.48550/arxiv.2609.00237v1]. S30 +6,62pp via proyeksi prosedural tanpa agen ekstra; S40 token 8–20x hemat (6.000 vs 50–120K), misrouting 30,1%→8,2%.
  • Unfilled: belum ada context filtering engine untuk gerbang manusia (evidence bundle: diff esensial + hasil sandbox + skor risiko, bukan seluruh histori chat) — cegah reviewer fatigue.
  • Syarat final: Batch 2 dampak ukuran payload terhadap waktu/akurasi tinjauan manusia + retensi token multi-bahasa.
  • Link DEF: S35, S19, S30, S40, S28. Detail: 02_slr/synthesis/GAP-06.md.

GAP-07 — Batas Antar-Agen Rapuh + Jurang Spesifikasi-Eksekusi (empirical)

  • Tradeoff inti: S22 (OpenTelemetry × ChatDev): delay pesan A2A teramplifikasi 59,2x (median 6,6x), delay LLM 48,1x [DOI: 10.48550/arxiv.2608.24271v1]. S27 (1.080 serangan): ASR 0,61–0,86 (plan hijacking 0,81–0,86) tanpa verifikasi batas [DOI: 10.48550/arxiv.2608.00718v1]. S36: recall spesifikasi 92,3% (presisi 90,2%) tapi BER fungsional hanya 23,0%; feedback naif malah regresi 75,8%→12,1% [DOI: 10.48550/arxiv.2605.17535v2].
  • Unfilled: belum ada runtime telemetry trigger untuk gerbang manusia (anomali latensi / deviasi batas / indikasi hijack → bekukan aksi + eskalasi sebelum menyebar).
  • Syarat final: Batch 2 ambang anomali telemetri (normal vs serangan/retry liar) + integrasi OpenTelemetry skala repo penuh.
  • Link DEF: S22, S27, S36, S26, S21, S47. Detail: 02_slr/synthesis/GAP-07.md.

GAP-08 — Tandem Guardrail Deterministik + Kalibrasi Kontekstual (methodological)

  • Tradeoff inti: S16 (SPOQ wave-DAG): critical path 1,03–1,11 (speedup 14,3x), defek 0,34→0,20 — tapi retry liar >100x instalasi dependensi (EBUSY) tanpa guardrail [DOI: 10.48550/arxiv.2606.03115]. S44 (CADMAS-CTX): potong API 18,4→5,1 (-72,3%), tugas berantai 8,4%→24,8% [DOI: 10.48550/arxiv.2604.17950v1]. S34: partisi kohesi -45% latensi, -28% biaya (paralelisme naif malah +60% biaya); S11 (AgileCoder): executability 57,79%, 0 galat, biaya $0,44.
  • Unfilled: belum ada unifikasi DAG hierarkis + execution guardrail (retry lokal ≤2–3x) + kalibrasi risiko kontekstual (aksi ambigu → CEO gate).
  • Syarat final: Batch 2 iteration bounds optimal anti-runaway + validasi kalibrasi risiko multi-berkas skala besar (Scopus/IEEE/ACM).
  • Link DEF: S16, S44, S34, S11, S04, S39. Detail: 02_slr/synthesis/GAP-08.md.

Novelty matrix (6 mekanisme × 5 kelompok)

Matriks kebaruan memetakan M1 (dekomposisi peran) → M2 (koordinasi graf/DAG) → M3 (closed-loop/patch repair) → M4 (selective HITL gate, inti) → M5 (efisiensi konteks/memori) → M6 (observabilitas/robustness) terhadap G1–G5; tiap sel ber-triplet + SID, zero sel kosong. Unfilled intersection tunggal: selective HITL approval gate di atas orkestrasi hierarkis + closed-loop sandbox + sinyal telemetri — risiko rendah auto-lolos, risiko tinggi eskalasi. Sumber: 02_slr/synthesis/NOVELTY-matrix.md.