Fair Compression Benchmarking, Calibration-Aware Uncertainty Quantification, and Radiologist-Validated Explainability for Trustworthy Edge-Deployed COVID-19 Chest X-Ray Screening

Main Article Content

Bharat Tank, Mitul Patel, Soumya Das

Abstract

Background: COVID-19 diagnostic capacity remains limited in low- and middle-income countries (LMICs). Prior edge-AI benchmarking studies for COVID-19 chest X-ray (CXR) classification often compress proposed models more aggressively than baselines, introducing a systematic optimism bias.
Methods: We apply an identical three-stage Edge-Aware Optimisation Pipeline (dynamic-range quantisation, INT8 quantisation-aware training, structured L1-norm pruning) to seven architectures, including a proposed 1.91M-parameter hybrid CNN (HybridEdge-COVID), removing asymmetric-compression bias from the comparison. Performance is assessed via 5-fold stratified cross-validation (COVID-Xray-5k, n=5,000) and external validation on COVIDx CXR-3 (n=13,870). Bonferroni-corrected McNemar, TOST equivalence, DeLong AUC, calibration (ECE/Brier/MCE), and MC Dropout uncertainty tests are specified in the framework; their exact statistics require fold-level prediction files not available here and are reported as pending, not confirmed. Grad-CAM++ maps were validated by two radiologists on 75 COVID-19+ cases. Results: Under uniform compression, HybridEdge-COVID achieves 97.84±0.31% CV accuracy (95% CI 97.21-98.47%), AUC 0.981, MCC 0.957. ResNet18 (98.12%) and ResNet50 (98.23%) achieve nominally higher point-estimate accuracy; point-estimate McNemar p-values are provisionally non-significant for four of six baselines, with SqueezeNet provisionally inferior (p=0.004), pending exact computation. External validation yields 91.30% accuracy (95% CI 90.73-91.87%), AUC 0.943. On Raspberry Pi 4 (<USD 55): 8.93 s/100 images, 4.8 MB model, 47.2 MB peak RAM, Pareto-optimal among seven architectures. Dual-radiologist Grad-CAM++ validation yields kappa=0.71 (95% CI 0.61-0.81), 76.9% clinical feature consistency. McNemar/TOST decisions, DeLong Z-statistics, and calibration/MC Dropout values all remain provisional pending fold-level computation.
Conclusions: The primary contribution is a fair, uniform compression-benchmarking methodology; HybridEdge-COVID is a secondary, illustrative architecture evaluated within it. Confirmation of equivalence, AUC, and calibration claims awaits fold-level analysis. Limitations: binary classification only, no prospective clinical validation, preliminary two-radiologist XAI, transformer baselines excluded, Grad-CAM++ not on-device; multi-centre prospective validation is required before clinical use.

Article Details

Section
Articles