Jejak Audit & Koreksi Data (Audit Log)
Halaman ini mendokumentasikan jejak audit menyeluruh (full-matrix audit gate) terhadap 48 studi kandidat ekstraksi Batch-1 yang dilaksanakan pada 2026-09-10. Audit dilakukan oleh 10 agen independen dan diverifikasi langsung terhadap berkas naskah asli (local fulltext TXT/PDF) pada direktori 02_slr/extraction/ guna memastikan keaslian metrik, kalibrasi skor kualitas metodologi (QA), serta penempatan bukti penjangkar (provenance anchors).
1. Ringkasan Hasil Audit Matriks Batch-1
Berdasarkan berkas ringkasan audit 02_slr/extraction/DEF_summary_batch1.md dan skrip penerapan patch 02_slr/extraction/apply_audit_patch_v1.py:
- Status Inklusi / Eksklusi: 47 studi inklusi primer (
S01–S47) dipertahankan; 10 studi tereksklusi pada berkasDEF_excluded_batch1.csv. - Pemindahan Studi Sekunder S46 (
B1-140): NaskahB1-140(Rethinking Software Engineering for Agentic AI Systems) merupakan tinjauan pustaka multivokal (multivocal literature review terhadap 23 studi). Sesuai kriteria EC2/IC2, naskah ini dipindahkan dari matriks inklusi ke daftar studi tereksklusi (EXCLUDE-L2), kemudian seluruh kode pengenalPaper_IDdiurutkan ulang (re-SID) dariS01hinggaS47berdasarkanBID. - Pengisian Lengkap Peran & Level Ekstraksi: Kolom
RoledanExtraction_Levelyang sebelumnya belum terisi pada 41 baris kini telah terisi 100% (klasifikasi primary vs supporting, serta level teks penuh fulltext). - Penegakan Aturan Bukti QA \(\ge\) 9.0: Seluruh baris dengan skor QA \(\ge\) 9.0 wajib mencantumkan bukti penjangkar spesifik (Table, Section, atau Figure) dan tautan repositori artefak publik. Artikel pra-cetak (preprint) tanpa repositori publik resmi dibatasi skor maksimalnya pada 8.5.
- Distribusi Skor Kualitas (QA) Pasca-Audit:
- Rata-rata: 8.32 (minimum: 5.0, maksimum: 9.5).
- Kategori Tinggi (\(\ge 7.5\)): 43 studi (9.5: 6 studi, 9.0: 6 studi, 8.5: 18 studi, 8.0: 10 studi, 7.5: 3 studi).
- Kategori Sedang (\(5.0 - 7.0\)): 4 studi (7.0: 2 studi, 5.5: 1 studi, 5.0: 1 studi).
- Kategori Rendah (\(< 5.0\)): 0 studi.
- Berkas Cadangan & Skrip Penambal:
- Berkas cadangan pra-audit:
02_slr/extraction/DEF_matrix_batch1.pre-audit-20260910.bak - Skrip penambal audit:
02_slr/extraction/apply_audit_patch_v1.py
2. Rincian 6 Perbaikan Metrik Utama (Metric Fixes)
Audit menemukan dan memperbaiki 6 inkonsistensi pelaporan metrik kuantitatif antara draf awal dan teks naskah sumber asli:
1. S10 (B1-068) — AgentCoder
- Judul Studi: AgentCoder: Multi-Agent-based Code Generation with Iterative Testing and Optimisation
- Sebelum Audit:
- Primary:
Pass@1: 96.3% on HumanEval and 91.8% on MBPP (GPT-4), 79.9% on HumanEval and 79.3% on MBPP (GPT-3.5-turbo); Token overhead: 56.9K (HumanEval) and 66.3K (MBPP) with GPT-4 - Secondary:
Test generation accuracy: 87.8% (HumanEval), 89.9% (MBPP) with GPT-4; Code line coverage: 91.7% (HumanEval), 87.8% (MBPP); Execution time: 228.7s (HumanEval), 365.9s (MBPP); Multi-agent vs single-agent pass@1 improvement: +10.4% to +16.5% - Sesudah Audit:
- Primary:
Pass@1: 96.3% on HumanEval and 91.8% on MBPP (GPT-4), 79.9% on HumanEval and 89.9% on MBPP (GPT-3.5-turbo) (Table 1 p6); Token overhead: 56.9K (HumanEval) and 66.3K (MBPP) with GPT-4 [FAKTA-DOK pdf_cache/B1-068.txt] - Secondary:
Test generation accuracy (GPT-3.5-turbo, Table 4 p8): 87.8% (HumanEval), 89.9% (MBPP); Code line coverage (Table 5 p8): GPT-4 91.7% (HumanEval) / 92.3% (MBPP), GPT-3.5 89.5% (MBPP); Execution time: 228.7s (HumanEval), 365.9s (MBPP); Multi-agent vs single-agent pass@1 improvement: +10.4% to +16.5% - Sumber Pembuktian:
pdf_cache/B1-068.txtTabel 1 hal. 6, Tabel 4–5 hal. 8 (koreksi akurasi MBPP GPT-3.5-turbo dari 79.3% menjadi 89.9%, serta perbaikan label cakupan baris kode).
2. S11 (B1-070) — AgileCoder
- Judul Studi: AgileCoder: Dynamic Collaborative Agents for Software Development based on Agile Methodology
- Sebelum Audit:
- Secondary:
ProjectDev running time: 306s (vs ChatDev 7,440s, MetaGPT 3,029s); Expenses: \$0.44 (vs ChatDev \$0.12, MetaGPT \$0.02); Token usage: 36,818; Number of errors: 0 (vs ChatDev 6, MetaGPT 32); Average sprints: 1.64 - Sesudah Audit:
- Secondary:
ProjectDev total running time: 444s (vs ChatDev 120s, MetaGPT 48s); Avg time/sprint: 306s (AgileCoder); Expenses: \$0.44 (vs ChatDev \$0.12, MetaGPT \$0.02); Token usage: 36,818 (vs ChatDev 7,440, MetaGPT 3,029); Number of errors: 0 (vs ChatDev 6, MetaGPT 32); Average sprints: 1.64 [FAKTA-DOK pdf_cache/B1-070.txt Table 2] - Sumber Pembuktian:
pdf_cache/B1-070.txtTabel 2 (koreksi pergeseran kolom waktu eksekusi total 444s vs rata-rata sprint 306s, serta perbaikan korupsi teks lambang mata uang\$0.44akibat interpolasi shell).
3. S12 (B1-073) — MARE
- Judul Studi: MARE: Multi-Agents Collaboration Framework for Requirements Engineering
- Sebelum Audit:
- Secondary:
Precision and Recall across 10 evaluation cases; Human evaluation by 3 RE inspectors across 3 quality dimensions (Basic 0.78-1.21, Intermediate 1.53-1.92, Overall 1.54-1.98); Multi-agent vs single-agent ablation (+1.1% average F1) - Sesudah Audit:
- Secondary:
Precision and Recall across 10 evaluation cases; Human evaluation by 3 RE inspectors across 3 quality dimensions (Table VII): Completeness 0.78-1.21 (avg 0.98), Correctness 1.53-1.85 (avg 1.92), Consistency 1.54-1.95 (avg 1.98); Multi-agent vs single-agent ablation (+1.1% average F1) - Sumber Pembuktian:
pdf_cache/B1-073.txtTabel VII (koreksi nama dimensi evaluasi manusia menjadi Completeness, Correctness, dan Consistency beserta nilai rentang dan rata-rata eksak).
4. S15 (B1-088) — Regulatory Compliance Checking MAS
- Judul Studi: A Multi-Agent RAG Framework for Regulatory Compliance Checking of Software Requirements
- Sebelum Audit:
- Primary:
Requirements incompleteness detection correctness: Student evaluation: 69% correct, 25% partially correct, 6% incorrect (GDPR); 70% correct, 26% partially correct, 4% incorrect (Data Act). Expert evaluation: 66% correct, 21% partially correct, 13% incorrect (GDPR); expert feedback analysis across 20 Data Act cases. - Sesudah Audit:
- Primary:
Requirements incompleteness detection correctness: Student evaluation: 69% correct, 25% partially correct, 6% incorrect (GDPR); 70% correct, 26% partially correct, 4% incorrect (Data Act). Expert evaluation: 66% correct, 21% partially correct, 13% incorrect (GDPR); 78% correct, 21% partially correct, 1% incorrect (Data Act across 20 cases) [FAKTA-DOK pdf_cache/B1-088_annexure.txt Sec 3 / Fig 4] - Sumber Pembuktian:
pdf_cache/B1-088_annexure.txtSection 3 / Gambar 4 (penambahan angka evaluasi pakar untuk kepatuhan Data Act secara kuantitatif: 78% benar, 21% sebagian benar, 1% keliru).
5. S29 (B1-107) — AutoGlue
- Judul Studi: Bridging Behavior and Implementation: Automated Java Glue Code Generation for Behavior-Driven Development
- Sebelum Audit:
- Secondary:
Usability: 46.1% directly usable glue code (Exact match); partial match 38.2%; API Precision: 0.660, API Recall: 0.714; METEOR: 0.655, ROUGE-L (RL): 0.614. - Sesudah Audit:
- Secondary:
Usability: 46.1% directly usable glue code (Exact match); partial match 35.0% (457/1,307, Table 4); API Precision: 0.660, API Recall: 0.714; METEOR: 0.655, ROUGE-L (RL): 0.614. [FAKTA-DOK txt/B1-107.txt Table 4] - Sumber Pembuktian:
txt/B1-107.txtTabel 4 (koreksi persentase kecocokan parsial dari 38.2% menjadi 35.0% atau 457 dari 1.307 kasus uji).
6. S33 (B1-119) — MAAD
- Judul Studi: Bridging Requirements and Architecture: Multi-Agent Orchestration with External Knowledge and Hierarchical Memory
- Sebelum Audit:
- Primary:
Architecture-level structural metrics across 10 cases vs MetaGPT (Qwen3.5 backbone): lower structural complexity (SC), higher/superior cohesion in majority of projects, explicitly defined interface contracts (MetaGPT fails contract modeling across all cases); RAG vs no-RAG: coupling density decreases in 6/10 projects, cohesion tends to decrease with fragmentation, behavioral state complexity rises - Sesudah Audit:
- Primary:
Architecture structural metrics across 10 cases vs MetaGPT (Qwen3.5 backbone, Table 3): Structural Complexity SC MAAD 0.01-0.05 vs MetaGPT 0.13-0.23; Interface Complexity IC MetaGPT 0.00 all cases (fails contract modeling) vs MAAD 1.31-2.40; RAG vs no-RAG ablation (Table 4): coupling density CCD decreases in 6/10 projects (e.g. C2C 2.91->2.29, Case 3.78->2.29, MCS 3.32->2.01); cohesion tends to decrease with fragmentation, behavioral state complexity rises [FAKTA-DOK txt/B1-119.txt Table 3-4 / Sec 5.1] - Sumber Pembuktian:
txt/B1-119.txtBagian 5.1, Tabel 3 dan Tabel 4 (penggantian klaim naratif umum menjadi angka metrik kompleksitas struktural eksak SC 0.01–0.05 vs 0.13–0.23, IC 1.31–2.40 vs 0.00, serta data ablasi kopling RAG).
3. Rincian 13 Rekalibrasi Skor Kualitas (QA Recalibrations)
Sebanyak 13 studi disesuaikan skor kualitas metodologinya agar selaras dengan aturan batas atas (QA caps) dan transparansi artefak:
| BID | Paper ID | Judul Studi Singkat | Skor Awal | Skor Hasil Audit | Alasan Rekalibrasi & Dasar Penyesuaian |
|---|---|---|---|---|---|
B1-023 |
S02 | The Wheel of Intelligence | 9.5 | 8.5 | Artikel pra-cetak TechRxiv tanpa ketersediaan repositori kode publik (pemberlakuan batas atas preprint cap 8.5). |
B1-060 |
S08 | Human-In-The-Loop Software Development Agents (HULA) | 9.5 | 8.5 | Implementasi sistem menggunakan infrastruktur tertutup (proprietary Atlassian JIRA) tanpa URL repositori publik. |
B1-068 |
S10 | AgentCoder | 8.5 | 8.0 | Terdapat ketidaksesuaian pelaporan metrik awal serta publikasi pra-cetak hanya menyertakan lampiran templat prompt. |
B1-073 |
S12 | MARE (Requirements Engineering) | 9.0 | 8.5 | Batas atas pra-cetak arXiv (preprint cap) untuk naskah tanpa repositori replikasi mandiri terverifikasi. |
B1-093 |
S16 | SPOQ: Specialist Orchestrated Queuing | 9.5 | 9.0 | Kalibrasi proporsional naskah pra-cetak dengan ketersediaan repositori GitLab. |
B1-099 |
S21 | openJiuwen | 9.5 | 8.0 | Naskah tidak menyertakan bab formal analisis ancaman validitas (Threats to Validity). |
B1-106 |
S28 | AgenticRepair | 9.0 | 8.5 | Naskah pra-cetak menjanjikan paket replikasi pada jurnal TSE namun belum menyediakan URL repositori publik aktif saat penelaahan. |
B1-117 |
S32 | Replication Package Quality Evaluation | 7.5 | 7.0 | Studi evaluasi awal (preliminary) dengan ukuran sampel sangat terbatas (\(n = 5\)) tanpa ketersediaan artefak publik. |
B1-121 |
S35 | How Generation Architecture Shapes Code Complexity | 8.5 | 8.0 | Naskah pra-cetak independen tanpa tautan repositori eksperimen publik. |
B1-129 |
S40 | Retrieval-Conditioned Topology Selection (RGAO) | 8.5 | 8.5 | Penegasan evaluasi batas atas naskah dengan klaim repositori pendamping tanpa URL publik langsung. |
B1-134 |
S42 | PlayCoder | 10.0 | 9.5 | Rekalibrasi dari skor sempurna (10.0 ditolak); terdapat batasan orakel uji (false negative 16%) dan latensi polling antarmuka GUI. |
B1-136 |
S44 | CADMAS-CTX | 9.5 | 9.0 | Naskah tidak mencantumkan URL repositori kode mandiri di dalam teks makalah. |
B1-139 |
S45 | Production Code Translation Superset | 9.5 | 9.0 | Evaluasi pada repositori produksi internal perusahaan (proprietary codebase) tanpa ketersediaan dataset publik. |
4. Pemindahan Studi B1-140 ke Daftar Eksklusi
- Identitas Studi:
B1-140— Rethinking Software Engineering for Agentic AI Systems (arXiv cs.SE, 2026). - Posisi Awal: Sempat dimasukkan sebagai kandidat studi inklusi primer
S46. - Temuan Audit: Naskah merupakan studi sekunder berbentuk tinjauan literatur multivokal (multivocal literature review) yang merangkum 23 studi dan praktik industri, tanpa mengusulkan atau menguji sistem multi-agent empiris baru secara mandiri.
- Tindakan Audit: Dipindahkan ke daftar studi tereksklusi
DEF_excluded_batch1.csvdengan label alasanEC2: secondary study (multivocal literature review, 23 studies). Naskah dialihkan sebagai bahan diskursus latar belakang (snowballing) dan perumusan pertanyaan penelitian RQ1 dan RQ4, serupa dengan perlakuan pada studi sekunderB1-046danB1-083. - Dampak Penataan Matriks: Seluruh baris matriks inklusi pasca-B1-140 diindeks ulang secara deterministik sehingga total studi inklusi menjadi tepat 47 studi (S01–S47).