Lewati ke isi

Jejak Audit & Koreksi Data (Audit Log)

Halaman ini mendokumentasikan jejak audit menyeluruh (full-matrix audit gate) terhadap 48 studi kandidat ekstraksi Batch-1 yang dilaksanakan pada 2026-09-10. Audit dilakukan oleh 10 agen independen dan diverifikasi langsung terhadap berkas naskah asli (local fulltext TXT/PDF) pada direktori 02_slr/extraction/ guna memastikan keaslian metrik, kalibrasi skor kualitas metodologi (QA), serta penempatan bukti penjangkar (provenance anchors).


1. Ringkasan Hasil Audit Matriks Batch-1

Berdasarkan berkas ringkasan audit 02_slr/extraction/DEF_summary_batch1.md dan skrip penerapan patch 02_slr/extraction/apply_audit_patch_v1.py:

  • Status Inklusi / Eksklusi: 47 studi inklusi primer (S01S47) dipertahankan; 10 studi tereksklusi pada berkas DEF_excluded_batch1.csv.
  • Pemindahan Studi Sekunder S46 (B1-140): Naskah B1-140 (Rethinking Software Engineering for Agentic AI Systems) merupakan tinjauan pustaka multivokal (multivocal literature review terhadap 23 studi). Sesuai kriteria EC2/IC2, naskah ini dipindahkan dari matriks inklusi ke daftar studi tereksklusi (EXCLUDE-L2), kemudian seluruh kode pengenal Paper_ID diurutkan ulang (re-SID) dari S01 hingga S47 berdasarkan BID.
  • Pengisian Lengkap Peran & Level Ekstraksi: Kolom Role dan Extraction_Level yang sebelumnya belum terisi pada 41 baris kini telah terisi 100% (klasifikasi primary vs supporting, serta level teks penuh fulltext).
  • Penegakan Aturan Bukti QA \(\ge\) 9.0: Seluruh baris dengan skor QA \(\ge\) 9.0 wajib mencantumkan bukti penjangkar spesifik (Table, Section, atau Figure) dan tautan repositori artefak publik. Artikel pra-cetak (preprint) tanpa repositori publik resmi dibatasi skor maksimalnya pada 8.5.
  • Distribusi Skor Kualitas (QA) Pasca-Audit:
  • Rata-rata: 8.32 (minimum: 5.0, maksimum: 9.5).
  • Kategori Tinggi (\(\ge 7.5\)): 43 studi (9.5: 6 studi, 9.0: 6 studi, 8.5: 18 studi, 8.0: 10 studi, 7.5: 3 studi).
  • Kategori Sedang (\(5.0 - 7.0\)): 4 studi (7.0: 2 studi, 5.5: 1 studi, 5.0: 1 studi).
  • Kategori Rendah (\(< 5.0\)): 0 studi.
  • Berkas Cadangan & Skrip Penambal:
  • Berkas cadangan pra-audit: 02_slr/extraction/DEF_matrix_batch1.pre-audit-20260910.bak
  • Skrip penambal audit: 02_slr/extraction/apply_audit_patch_v1.py

2. Rincian 6 Perbaikan Metrik Utama (Metric Fixes)

Audit menemukan dan memperbaiki 6 inkonsistensi pelaporan metrik kuantitatif antara draf awal dan teks naskah sumber asli:

1. S10 (B1-068) — AgentCoder

  • Judul Studi: AgentCoder: Multi-Agent-based Code Generation with Iterative Testing and Optimisation
  • Sebelum Audit:
  • Primary: Pass@1: 96.3% on HumanEval and 91.8% on MBPP (GPT-4), 79.9% on HumanEval and 79.3% on MBPP (GPT-3.5-turbo); Token overhead: 56.9K (HumanEval) and 66.3K (MBPP) with GPT-4
  • Secondary: Test generation accuracy: 87.8% (HumanEval), 89.9% (MBPP) with GPT-4; Code line coverage: 91.7% (HumanEval), 87.8% (MBPP); Execution time: 228.7s (HumanEval), 365.9s (MBPP); Multi-agent vs single-agent pass@1 improvement: +10.4% to +16.5%
  • Sesudah Audit:
  • Primary: Pass@1: 96.3% on HumanEval and 91.8% on MBPP (GPT-4), 79.9% on HumanEval and 89.9% on MBPP (GPT-3.5-turbo) (Table 1 p6); Token overhead: 56.9K (HumanEval) and 66.3K (MBPP) with GPT-4 [FAKTA-DOK pdf_cache/B1-068.txt]
  • Secondary: Test generation accuracy (GPT-3.5-turbo, Table 4 p8): 87.8% (HumanEval), 89.9% (MBPP); Code line coverage (Table 5 p8): GPT-4 91.7% (HumanEval) / 92.3% (MBPP), GPT-3.5 89.5% (MBPP); Execution time: 228.7s (HumanEval), 365.9s (MBPP); Multi-agent vs single-agent pass@1 improvement: +10.4% to +16.5%
  • Sumber Pembuktian: pdf_cache/B1-068.txt Tabel 1 hal. 6, Tabel 4–5 hal. 8 (koreksi akurasi MBPP GPT-3.5-turbo dari 79.3% menjadi 89.9%, serta perbaikan label cakupan baris kode).

2. S11 (B1-070) — AgileCoder

  • Judul Studi: AgileCoder: Dynamic Collaborative Agents for Software Development based on Agile Methodology
  • Sebelum Audit:
  • Secondary: ProjectDev running time: 306s (vs ChatDev 7,440s, MetaGPT 3,029s); Expenses: \$0.44 (vs ChatDev \$0.12, MetaGPT \$0.02); Token usage: 36,818; Number of errors: 0 (vs ChatDev 6, MetaGPT 32); Average sprints: 1.64
  • Sesudah Audit:
  • Secondary: ProjectDev total running time: 444s (vs ChatDev 120s, MetaGPT 48s); Avg time/sprint: 306s (AgileCoder); Expenses: \$0.44 (vs ChatDev \$0.12, MetaGPT \$0.02); Token usage: 36,818 (vs ChatDev 7,440, MetaGPT 3,029); Number of errors: 0 (vs ChatDev 6, MetaGPT 32); Average sprints: 1.64 [FAKTA-DOK pdf_cache/B1-070.txt Table 2]
  • Sumber Pembuktian: pdf_cache/B1-070.txt Tabel 2 (koreksi pergeseran kolom waktu eksekusi total 444s vs rata-rata sprint 306s, serta perbaikan korupsi teks lambang mata uang \$0.44 akibat interpolasi shell).

3. S12 (B1-073) — MARE

  • Judul Studi: MARE: Multi-Agents Collaboration Framework for Requirements Engineering
  • Sebelum Audit:
  • Secondary: Precision and Recall across 10 evaluation cases; Human evaluation by 3 RE inspectors across 3 quality dimensions (Basic 0.78-1.21, Intermediate 1.53-1.92, Overall 1.54-1.98); Multi-agent vs single-agent ablation (+1.1% average F1)
  • Sesudah Audit:
  • Secondary: Precision and Recall across 10 evaluation cases; Human evaluation by 3 RE inspectors across 3 quality dimensions (Table VII): Completeness 0.78-1.21 (avg 0.98), Correctness 1.53-1.85 (avg 1.92), Consistency 1.54-1.95 (avg 1.98); Multi-agent vs single-agent ablation (+1.1% average F1)
  • Sumber Pembuktian: pdf_cache/B1-073.txt Tabel VII (koreksi nama dimensi evaluasi manusia menjadi Completeness, Correctness, dan Consistency beserta nilai rentang dan rata-rata eksak).

4. S15 (B1-088) — Regulatory Compliance Checking MAS

  • Judul Studi: A Multi-Agent RAG Framework for Regulatory Compliance Checking of Software Requirements
  • Sebelum Audit:
  • Primary: Requirements incompleteness detection correctness: Student evaluation: 69% correct, 25% partially correct, 6% incorrect (GDPR); 70% correct, 26% partially correct, 4% incorrect (Data Act). Expert evaluation: 66% correct, 21% partially correct, 13% incorrect (GDPR); expert feedback analysis across 20 Data Act cases.
  • Sesudah Audit:
  • Primary: Requirements incompleteness detection correctness: Student evaluation: 69% correct, 25% partially correct, 6% incorrect (GDPR); 70% correct, 26% partially correct, 4% incorrect (Data Act). Expert evaluation: 66% correct, 21% partially correct, 13% incorrect (GDPR); 78% correct, 21% partially correct, 1% incorrect (Data Act across 20 cases) [FAKTA-DOK pdf_cache/B1-088_annexure.txt Sec 3 / Fig 4]
  • Sumber Pembuktian: pdf_cache/B1-088_annexure.txt Section 3 / Gambar 4 (penambahan angka evaluasi pakar untuk kepatuhan Data Act secara kuantitatif: 78% benar, 21% sebagian benar, 1% keliru).

5. S29 (B1-107) — AutoGlue

  • Judul Studi: Bridging Behavior and Implementation: Automated Java Glue Code Generation for Behavior-Driven Development
  • Sebelum Audit:
  • Secondary: Usability: 46.1% directly usable glue code (Exact match); partial match 38.2%; API Precision: 0.660, API Recall: 0.714; METEOR: 0.655, ROUGE-L (RL): 0.614.
  • Sesudah Audit:
  • Secondary: Usability: 46.1% directly usable glue code (Exact match); partial match 35.0% (457/1,307, Table 4); API Precision: 0.660, API Recall: 0.714; METEOR: 0.655, ROUGE-L (RL): 0.614. [FAKTA-DOK txt/B1-107.txt Table 4]
  • Sumber Pembuktian: txt/B1-107.txt Tabel 4 (koreksi persentase kecocokan parsial dari 38.2% menjadi 35.0% atau 457 dari 1.307 kasus uji).

6. S33 (B1-119) — MAAD

  • Judul Studi: Bridging Requirements and Architecture: Multi-Agent Orchestration with External Knowledge and Hierarchical Memory
  • Sebelum Audit:
  • Primary: Architecture-level structural metrics across 10 cases vs MetaGPT (Qwen3.5 backbone): lower structural complexity (SC), higher/superior cohesion in majority of projects, explicitly defined interface contracts (MetaGPT fails contract modeling across all cases); RAG vs no-RAG: coupling density decreases in 6/10 projects, cohesion tends to decrease with fragmentation, behavioral state complexity rises
  • Sesudah Audit:
  • Primary: Architecture structural metrics across 10 cases vs MetaGPT (Qwen3.5 backbone, Table 3): Structural Complexity SC MAAD 0.01-0.05 vs MetaGPT 0.13-0.23; Interface Complexity IC MetaGPT 0.00 all cases (fails contract modeling) vs MAAD 1.31-2.40; RAG vs no-RAG ablation (Table 4): coupling density CCD decreases in 6/10 projects (e.g. C2C 2.91->2.29, Case 3.78->2.29, MCS 3.32->2.01); cohesion tends to decrease with fragmentation, behavioral state complexity rises [FAKTA-DOK txt/B1-119.txt Table 3-4 / Sec 5.1]
  • Sumber Pembuktian: txt/B1-119.txt Bagian 5.1, Tabel 3 dan Tabel 4 (penggantian klaim naratif umum menjadi angka metrik kompleksitas struktural eksak SC 0.01–0.05 vs 0.13–0.23, IC 1.31–2.40 vs 0.00, serta data ablasi kopling RAG).

3. Rincian 13 Rekalibrasi Skor Kualitas (QA Recalibrations)

Sebanyak 13 studi disesuaikan skor kualitas metodologinya agar selaras dengan aturan batas atas (QA caps) dan transparansi artefak:

BID Paper ID Judul Studi Singkat Skor Awal Skor Hasil Audit Alasan Rekalibrasi & Dasar Penyesuaian
B1-023 S02 The Wheel of Intelligence 9.5 8.5 Artikel pra-cetak TechRxiv tanpa ketersediaan repositori kode publik (pemberlakuan batas atas preprint cap 8.5).
B1-060 S08 Human-In-The-Loop Software Development Agents (HULA) 9.5 8.5 Implementasi sistem menggunakan infrastruktur tertutup (proprietary Atlassian JIRA) tanpa URL repositori publik.
B1-068 S10 AgentCoder 8.5 8.0 Terdapat ketidaksesuaian pelaporan metrik awal serta publikasi pra-cetak hanya menyertakan lampiran templat prompt.
B1-073 S12 MARE (Requirements Engineering) 9.0 8.5 Batas atas pra-cetak arXiv (preprint cap) untuk naskah tanpa repositori replikasi mandiri terverifikasi.
B1-093 S16 SPOQ: Specialist Orchestrated Queuing 9.5 9.0 Kalibrasi proporsional naskah pra-cetak dengan ketersediaan repositori GitLab.
B1-099 S21 openJiuwen 9.5 8.0 Naskah tidak menyertakan bab formal analisis ancaman validitas (Threats to Validity).
B1-106 S28 AgenticRepair 9.0 8.5 Naskah pra-cetak menjanjikan paket replikasi pada jurnal TSE namun belum menyediakan URL repositori publik aktif saat penelaahan.
B1-117 S32 Replication Package Quality Evaluation 7.5 7.0 Studi evaluasi awal (preliminary) dengan ukuran sampel sangat terbatas (\(n = 5\)) tanpa ketersediaan artefak publik.
B1-121 S35 How Generation Architecture Shapes Code Complexity 8.5 8.0 Naskah pra-cetak independen tanpa tautan repositori eksperimen publik.
B1-129 S40 Retrieval-Conditioned Topology Selection (RGAO) 8.5 8.5 Penegasan evaluasi batas atas naskah dengan klaim repositori pendamping tanpa URL publik langsung.
B1-134 S42 PlayCoder 10.0 9.5 Rekalibrasi dari skor sempurna (10.0 ditolak); terdapat batasan orakel uji (false negative 16%) dan latensi polling antarmuka GUI.
B1-136 S44 CADMAS-CTX 9.5 9.0 Naskah tidak mencantumkan URL repositori kode mandiri di dalam teks makalah.
B1-139 S45 Production Code Translation Superset 9.5 9.0 Evaluasi pada repositori produksi internal perusahaan (proprietary codebase) tanpa ketersediaan dataset publik.

4. Pemindahan Studi B1-140 ke Daftar Eksklusi

  • Identitas Studi: B1-140Rethinking Software Engineering for Agentic AI Systems (arXiv cs.SE, 2026).
  • Posisi Awal: Sempat dimasukkan sebagai kandidat studi inklusi primer S46.
  • Temuan Audit: Naskah merupakan studi sekunder berbentuk tinjauan literatur multivokal (multivocal literature review) yang merangkum 23 studi dan praktik industri, tanpa mengusulkan atau menguji sistem multi-agent empiris baru secara mandiri.
  • Tindakan Audit: Dipindahkan ke daftar studi tereksklusi DEF_excluded_batch1.csv dengan label alasan EC2: secondary study (multivocal literature review, 23 studies). Naskah dialihkan sebagai bahan diskursus latar belakang (snowballing) dan perumusan pertanyaan penelitian RQ1 dan RQ4, serupa dengan perlakuan pada studi sekunder B1-046 dan B1-083.
  • Dampak Penataan Matriks: Seluruh baris matriks inklusi pasca-B1-140 diindeks ulang secara deterministik sehingga total studi inklusi menjadi tepat 47 studi (S01–S47).