# Multi-Fidelity Bayesian Inverse Analysis for Reactive Transport in Groundwater: Source Attribution and Information-Optimal Monitoring

## Metadata

- **SPORE ID**: SPR-2026-4F73
- **Domaines**: Computational Physics and Python Applications x Water Quality and Resources Studies
- **Date de generation**: 2026-09-22
- **Panel consensus score**: 6.2/10
- **Novelty score**: 0.72/1.0
- **Panel verdict**: publish_brief

## Abstract

If a non-linear multi-fidelity Gaussian process surrogate (Kennedy–O'Hagan AR1) is used to approximate a reactive transport model within a Bayesian inverse framework, then the 95% credible interval width for source-attribution parameters (e.g., contaminant release rate, reaction rate) will be reduced by ≥40% relative to single-fidelity inversion at equal computational budget, because the low-fidelity level resolves the posterior's global structure while the high-fidelity level corrects local bias; and the expected information gain (EIG) computed on the surrogate will correlate with the high-fidelity EIG with Pearson r ≥ 0.85 across candidate monitoring designs.

The proposed mechanism involves 5 causal steps: (1) Construct a low-fidelity surrogate (e.g., coarse-grid advection-dispersion or re -> (2) Train a non-linear multi-fidelity GP (AR1 chaining) on N_low low-fidelity and N_ -> (3) Perform Bayesian inversion using the multi-fidelity GP as a surrogate for the li -> (4) Compute the expected information gain (EIG) for candidate monitoring designs usi.

Literature grounding on 18 verified references yields a novelty score of 0.72 (incremental). A 3-phase experimental protocol (budget: €18k-120k, timeline: 8-14 months) is proposed, starting with in silico validation. A panel of 5 expert reviewers reached a consensus score of 6.2/10.

## 1. Hypothese et mecanisme propose

### 1.1 Formulation formelle

If a non-linear multi-fidelity Gaussian process surrogate (Kennedy–O'Hagan AR1) is used to approximate a reactive transport model within a Bayesian inverse framework, then the 95% credible interval width for source-attribution parameters (e.g., contaminant release rate, reaction rate) will be reduced by ≥40% relative to single-fidelity inversion at equal computational budget, because the low-fidelity level resolves the posterior's global structure while the high-fidelity level corrects local bias; and the expected information gain (EIG) computed on the surrogate will correlate with the high-fidelity EIG with Pearson r ≥ 0.85 across candidate monitoring designs.

### 1.2 Variables

**Variables independantes :**

| Variable | Type | Plage | Unite |
|----------|------|-------|-------|
| High-fidelity model evaluations (N_high) | continuous | 10–100 | simulations |
| Low-fidelity model evaluations (N_low) | continuous | 100–5000 | simulations |
| Fidelity correlation coefficient (ρ) | continuous | 0.5–0.99 | dimensionless |
| Observation noise correlation length (ℓ_obs) | continuous | 0–10 | km |
| Number of monitoring wells (n_wells) | ordinal | 5–50 | wells |
| Acquisition strategy | categorical | sequential | batch | N/A |

**Variables dependantes :**

| Variable | Type | Direction attendue | Unite |
|----------|------|-------------------|-------|
| 95% credible interval width for source release rate | continuous | decrease | kg/day |
| Posterior mean error for reaction rate constant | continuous | decrease | mol/L/s |
| Expected information gain (EIG) on surrogate | continuous | increase | nats |
| Pearson correlation between surrogate EIG and high-fidelity EIG | continuous | increase | dimensionless |
| Predictive coverage of 95% intervals | continuous | non-monotonic | fraction |
| Discrepancy term identifiability (profile likelihood curvature) | continuous | increase | dimensionless |

### 1.3 Chaine causale

1. Step 1: Construct a low-fidelity surrogate (e.g., coarse-grid advection-dispersion or reduced-order model) that captures the global posterior structure of reactive transport parameters at low computational cost.
1. Step 2: Train a non-linear multi-fidelity GP (AR1 chaining) on N_low low-fidelity and N_high high-fidelity simulations, with a discrepancy term δ(x) modeled as a sparse GP with an informative prior.
1. Step 3: Perform Bayesian inversion using the multi-fidelity GP as a surrogate for the likelihood, sampling the posterior with MCMC or variational inference.
1. Step 4: Compute the expected information gain (EIG) for candidate monitoring designs using the surrogate, and validate against nested Monte Carlo on the high-fidelity model.
1. Step 5: Quantify the reduction in credible interval width relative to single-fidelity inversion at equal computational budget, and assess the robustness of the discrepancy term to rank inversion between fidelity levels.

**Hypotheses cles :**

- The low-fidelity model is correlated with the high-fidelity model with ρ ≥ 0.5 across the parameter space.
- The discrepancy term δ(x) is smooth and can be represented by a sparse GP with a Matérn kernel.
- Observation errors after log-transformation are spatially correlated and heteroscedastic, modeled by a Matérn covariance with unknown correlation length and variance.
- The high-fidelity reactive transport model is structurally correct for the synthetic scenarios used in Phase 1 (no missing reaction pathways).
- The EIG computed on the surrogate is an unbiased estimator of the high-fidelity EIG when the surrogate is well-calibrated.

**Inconnues identifiees :**

- Whether the discrepancy term remains identifiable at N_high = 20 when the low-fidelity model has a rank inversion (i.e., the low-fidelity model is more accurate in some regions than the high-fidelity model).
- The magnitude of the outer-loop bias in EIG estimation when using a surrogate, and whether it can be corrected by a control variate or importance sampling.
- The impact of spatially correlated observation errors on the predictive coverage of the multi-fidelity posterior.
- Whether the multi-fidelity GP can handle structural model error (e.g., omitted reaction pathways) without overfitting the discrepancy term.

### 1.4 Conditions aux limites

- **The low-fidelity model must have a rank correlation with the high-fidelity model of at least 0.5 across the parameter space.** — Below this threshold, the multi-fidelity GP cannot effectively transfer information, and the discrepancy term dominates.
- **The number of high-fidelity simulations N_high must be at least 10 to train the AR1 GP.** — With fewer than 10 high-fidelity points, the GP hyperparameters are not identifiable.
- **Observation errors after log-transformation must have a correlation length ℓ_obs ≤ 10 km.** — Beyond this length, the spatial correlation is indistinguishable from a constant bias, and the likelihood becomes non-identifiable.
- **The reactive transport model must include at least the primary reaction pathway; omission of the primary pathway invalidates the surrogate.** — The multi-fidelity GP cannot correct for a structurally wrong high-fidelity model if the error is not smooth.

### 1.5 Cadre theorique

Multi-fidelity Bayesian inverse analysis with Gaussian process surrogates (Kennedy & O'Hagan 2000; Perdikaris et al. 2017) and expected information gain for optimal experimental design (Huan et al. 2024).

## 2. Etat de l'art et positionnement

### 2.1 Travaux les plus proches

- **[2018] An adaptive Kriging surrogate method for efficient joint estimation of hydraulic and biochemical parameters in reactive transport modeling.** — [10.1016/j.jconhyd.2018.08.005](https://doi.org/10.1016/j.jconhyd.2018.08.005)
  - Similarite: very_related
  - Difference cle: This paper already implements Bayesian inference (MCMC) with a Kriging surrogate for reactive transport parameter calibration, achieving ~100x speedup. The SPORE hypothesis differs by proposing multi-fidelity (not single-fidelity surrogate) Bayesian inversion, explicit fusion of heterogeneous data types, and extension to optimal monitoring network design via expected information gain — none of which are addressed here.
- **[2021] Integrating Process‐Based Reactive Transport Modeling and Machine Learning for Electrokinetic Remediation of Contaminated Groundwater** — [10.1029/2021WR029959](https://doi.org/10.1029/2021WR029959)
  - Similarite: related
  - Difference cle: Demonstrates ML surrogates trained on reactive transport outputs for groundwater remediation, but uses deterministic response surfaces (ANN) without Bayesian uncertainty quantification, multi-fidelity hierarchy, or OED. SPORE adds probabilistic inversion and information-gain-driven design.
- **[2024] Multi-fidelity Gaussian process surrogate modeling for regression problems in physics** — [10.1088/2632-2153/ad7ad5](https://doi.org/10.1088/2632-2153/ad7ad5)
  - Similarite: related
  - Difference cle: Provides the multi-fidelity GP methodology in a physics context but does not address groundwater hydrology, reactive transport, source attribution, or monitoring network design. SPORE transfers this methodology to Domain B.
- **[2024] Optimal experimental design: Formulations and computations** — [10.1017/S0962492924000023](https://doi.org/10.1017/S0962492924000023)
  - Similarite: related
  - Difference cle: Comprehensive OED survey covering expected information gain formulations, but not applied to groundwater quality monitoring networks nor coupled with multi-fidelity surrogates for reactive transport.

### 2.2 Base de preuves

- **[2018] An adaptive Kriging surrogate method for efficient joint estimation of hydraulic and biochemical parameters in reactive transport modeling.** — [10.1016/j.jconhyd.2018.08.005](https://doi.org/10.1016/j.jconhyd.2018.08.005)
  - Type: direct | Citations: 23
  - Directly demonstrates that surrogate-accelerated Bayesian inference (MCMC) is feasible and efficient for reactive transport parameter estimation in groundwater — the core methodological claim of SPORE, though limited to single-fidelity surrogates.
- **[2021] Integrating Process‐Based Reactive Transport Modeling and Machine Learning for Electrokinetic Remediation of Contaminated Groundwater** — [10.1029/2021WR029959](https://doi.org/10.1029/2021WR029959)
  - Type: direct | Citations: 40
  - Confirms that ML surrogate models trained on a limited number of expensive reactive transport simulations can predict complex subsurface contaminant evolution — validating the low-fidelity surrogate premise of SPORE.
- **[2024] Multi-fidelity Gaussian process surrogate modeling for regression problems in physics** — [10.1088/2632-2153/ad7ad5](https://doi.org/10.1088/2632-2153/ad7ad5)
  - Type: direct | Citations: 24
  - Provides the multi-fidelity GP surrogate methodology (non-linear autoregressive chaining of fidelity levels) that SPORE proposes to transfer to groundwater hydrology.
- **[2024] Multi-Fidelity Methods for Optimization: A Survey** — [10.1145/3801959](https://doi.org/10.1145/3801959)
  - Type: indirect | Citations: 32
  - Systematic survey of multi-fidelity surrogate models, fidelity management, and optimization — provides the general framework SPORE claims to transfer, but not in a Bayesian inverse or groundwater context.
- **[2024] Optimal experimental design: Formulations and computations** — [10.1017/S0962492924000023](https://doi.org/10.1017/S0962492924000023)
  - Type: indirect | Citations: 126
  - Provides the OED formalism (expected information gain criteria) that SPORE proposes to apply for monitoring network design, but does not address groundwater or multi-fidelity surrogates.
- **[2020] Optimal Experimental Design for Inverse Problems in the Presence of Observation Correlations** — [10.1137/21m1418666](https://doi.org/10.1137/21m1418666)
  - Type: indirect | Citations: 23
  - Addresses OED for Bayesian linear inverse problems with correlated observation errors — relevant to SPORE's goal of fusing heterogeneous groundwater data with non-Gaussian/correlated errors, though not applied to hydrology.
- **[2016] Entropy-Based Experimental Design for Optimal Model Discrimination in the Geosciences** — [10.3390/E18110409](https://doi.org/10.3390/E18110409)
  - Type: direct | Citations: 35
  - Demonstrates entropy-based OED for model selection in geosciences — directly supports SPORE's claim that information-gain-driven design is applicable in Earth science contexts.
- **[2018] A systematic assessment and reduction of parametric uncertainties for a distributed hydrological model** — [10.1016/J.JHYDROL.2018.07.055](https://doi.org/10.1016/J.JHYDROL.2018.07.055)
  - Type: direct | Citations: 32
  - Combines sensitivity analysis with adaptive surrogate-based multi-objective optimization for hydrological model parameter uncertainty — supports the surrogate-accelerated UQ premise in a hydrological (though not reactive transport) context.
- **[2021] Uncertainty quantification and inverse modeling for subsurface flow in 3D heterogeneous formations using a theory-guided convolutional encoder-decoder network** — [10.1016/j.jhydrol.2022.128321](https://doi.org/10.1016/j.jhydrol.2022.128321)
  - Type: direct | Citations: 26
  - Demonstrates surrogate-based UQ and inverse modeling for 3D subsurface flow — supports the transferability of surrogate-based Bayesian inversion to subsurface hydrology, though for single-phase flow rather than reactive transport.
- **[2020] B-PINNs: Bayesian Physics-Informed Neural Networks for Forward and Inverse PDE Problems with Noisy Data** — [10.1016/j.jcp.2020.109913](https://doi.org/10.1016/j.jcp.2020.109913)
  - Type: analogous | Citations: 1235
  - Demonstrates Bayesian inversion of PDEs with noisy scattered data — structurally analogous to SPORE's problem, but uses PINNs rather than multi-fidelity surrogates and is not applied to groundwater.
- **[2020] Statistical guarantees for Bayesian uncertainty quantification in nonlinear inverse problems with Gaussian process priors** — [10.1214/21-aos2082](https://doi.org/10.1214/21-aos2082)
  - Type: analogous | Citations: 51
  - Provides theoretical foundations (Bernstein-von Mises) for Bayesian UQ in nonlinear inverse problems — supports the mathematical validity of SPORE's Bayesian framework, though not specific to multi-fidelity or hydrology.
- **[2023] Deep Operator Learning-based Surrogate Models with Uncertainty Quantification for Optimizing Internal Cooling Channel Rib Profiles** — [10.48550/arXiv.2306.00810](https://doi.org/10.48550/arXiv.2306.00810)
  - Type: analogous | Citations: 37
  - Demonstrates Bayesian DeepONet surrogates with UQ for optimization in computational physics — analogous to SPORE's surrogate-with-UQ approach, but in thermal engineering rather than hydrology.
- **[2023] High-dimensional multi-fidelity Bayesian optimization for quantum control** — [10.1088/2632-2153/ad0100](https://doi.org/10.1088/2632-2153/ad0100)
  - Type: analogous | Citations: 23
  - Demonstrates multi-fidelity Bayesian optimization for inverse problems in quantum control — analogous methodological transfer of multi-fidelity BO to a new domain, supporting SPORE's transfer claim.
- **[2024] Driving factor, source identification, and health risk of PFAS contamination in groundwater based on the self-organizing map.** — [10.1016/j.watres.2024.122458](https://doi.org/10.1016/j.watres.2024.122458)
  - Type: indirect | Citations: 55
  - Demonstrates current practice for groundwater contaminant source attribution using SOM, K-means, PMF — deterministic/statistical methods that SPORE aims to replace with probabilistic Bayesian source attribution.
- **[2024] Unravelling integrated groundwater management in pollution-prone agricultural cities: A synergistic approach combining probabilistic risk, source apportionment and artificial intelligence.** — [10.1016/j.jhazmat.2024.136514](https://doi.org/10.1016/j.jhazmat.2024.136514)
  - Type: indirect | Citations: 22
  - Combines probabilistic risk, source apportionment, and AI for groundwater management — shows the demand for probabilistic source attribution in Domain B, but uses statistical/AI methods rather than multi-fidelity Bayesian inversion.
- **[2022] Multi-objective optimization-based reactive nitrogen transport modeling for the water-environment-agriculture nexus in a basin-scale coastal aquifer.** — [10.1016/j.watres.2022.118111](https://doi.org/10.1016/j.watres.2022.118111)
  - Type: indirect | Citations: 33
  - Couples SEAWAT and RT3D for reactive transport simulation-optimization at basin scale — demonstrates the computational expense of reactive transport models that SPORE aims to address with multi-fidelity surrogates.
- **[2025] Analysis of heavy metal contamination in groundwater and associated probabilistic human health risk assessment using Monte Carlo simulation: A case study in Gaya, Bihar.** — [10.2166/wh.2025.348](https://doi.org/10.2166/wh.2025.348)
  - Type: indirect | Citations: 20
  - Uses Monte Carlo simulation for probabilistic health risk from groundwater heavy metals — demonstrates probabilistic methods in Domain B but without Bayesian inversion or multi-fidelity surrogates.
- **[2024] Heavy Metal Contamination Assessment and Source Attribution in the Vicinity of an Iron Slag Pile in Hechi, China: Integrating Multi-Medium Analysis.** — [10.1016/j.envres.2024.120206](https://doi.org/10.1016/j.envres.2024.120206)
  - Type: indirect | Citations: 21
  - Multi-medium contamination assessment and source attribution — demonstrates the data heterogeneity challenge (water, sediment, soil, crops) that SPORE aims to fuse within a single Bayesian framework.

### 2.3 Contre-preuves et limitations connues

- **[serious] An adaptive Kriging surrogate method for efficient joint estimation of hydraulic and biochemical parameters in reactive transport modeling.**
  - This paper already demonstrates that single-fidelity surrogate-accelerated Bayesian inference works for reactive transport parameter estimation, suggesting the core methodological claim of SPORE (surrogate + Bayesian inversion for reactive transport) is not novel — only the multi-fidelity extension and OED components are.
- **[minor] Integrating Process‐Based Reactive Transport Modeling and Machine Learning for Electrokinetic Remediation of Contaminated Groundwater**
  - Demonstrates that ML surrogates for reactive transport in groundwater are already established practice, reducing the novelty of the surrogate component of SPORE.
- **[addressable] Driving factor, source identification, and health risk of PFAS contamination in groundwater based on the self-organizing map.**
  - Shows that source attribution in groundwater is currently done with deterministic/statistical methods (SOM, PMF) that practitioners accept — suggesting the Bayesian probabilistic alternative may face adoption barriers, though this is not a scientific contradiction.

### 2.4 Evaluation de nouveaute

- **Score**: 0.72/1.0
- **Verdict**: incremental

## 3. Predictions falsifiables

| # | Prediction | Borne quantitative | Methode | H0 | Test statistique |
|---|-----------|-------------------|---------|-----|-----------------|
| 1 | Multi-fidelity Bayesian inversion reduces the 95% credible interval width for the source release rate by ≥40% compared to single-fidelity inversion at equal computational budget (N_high = 20, N_low = 1000). | Median reduction in CI width ≥ 40% across 100 synthetic scenarios, with 95% confidence interval of the reduction [35%, 45%]. | Compute CI widths from posterior samples for both methods; use paired bootstrap to estimate the reduction and its confidence interval. | H0: The median reduction in CI width is ≤ 0% (no improvement). | Paired Wilcoxon signed-rank test, alpha = 0.05, power = 0.80, with a priori power analysis indicating 100 scenarios are needed to detect a 40% reduction with SD = 15%. |
| 2 | The discrepancy term δ(x) in the multi-fidelity GP is identifiable at N_high = 20, as measured by a profile likelihood curvature > 0.1 (on a normalized scale) for all parameters. | Profile likelihood curvature > 0.1 for each discrepancy parameter in 90% of 100 synthetic scenarios. | Compute profile likelihoods for each discrepancy parameter by fixing it and optimizing the others; measure the curvature at the MLE. | H0: The profile likelihood curvature is ≤ 0.1 for at least one discrepancy parameter. | Binomial test for proportion of scenarios with curvature > 0.1, alpha = 0.05. |
| 3 | The Pearson correlation between surrogate-computed EIG and high-fidelity EIG (via nested Monte Carlo) is ≥ 0.85 across 50 candidate monitoring designs. | Pearson r ≥ 0.85 with 95% CI [0.80, 0.90]. | Compute EIG on surrogate and on high-fidelity model for each design; calculate Pearson correlation and bootstrap CI. | H0: Pearson r ≤ 0.70. | Fisher z-transformation test for correlation, alpha = 0.05. |
| 4 | The 95% predictive intervals for observed concentrations have coverage between 93% and 97% when observation errors are spatially correlated with correlation length ℓ_obs = 5 km. | Empirical coverage in [93%, 97%] across 1000 test points. | Generate synthetic observations with correlated errors; compute the proportion of test points falling within the 95% predictive interval. | H0: Coverage is outside [93%, 97%]. | Binomial test for coverage, alpha = 0.05. |
| 5 | The multi-fidelity GP maintains a posterior mean error for the reaction rate constant below 10% of the true value when the high-fidelity model omits a secondary reaction pathway (structural error). | Relative error ≤ 10% in 80% of 50 scenarios with omitted reaction. | Compare posterior mean to true reaction rate constant in synthetic scenarios with a missing reaction. | H0: Relative error > 10% in more than 20% of scenarios. | Binomial test, alpha = 0.05. |

## 4. Protocole experimental

**Timeline globale**: 8-14 months
**Budget global**: €18k-120k

### 4.1 Phase 1 — In Silico Validation

**Objectif**: Determine whether a non-linear multi-fidelity GP (AR1) surrogate can reduce posterior CI width by ≥40% and whether surrogate EIG correlates with high-fidelity EIG (r≥0.85) under controlled synthetic conditions, before any physical experiment.

**Methodologie**: Build a synthetic 2D reactive transport testbed (advection-dispersion + first-order degradation) in PFLOTRAN or MODFLOW/MT3DMS. Define high-fidelity (fine grid, 200x200, full reactions) and low-fidelity (coarse grid 50x50, simplified kinetics) models. Sample N_low=1000 low-fidelity runs via Latin Hypercube over source release rate, reaction rate, dispersivity, and well positions. Run N_high=20 high-fidelity runs at a subset of LHS points. Train AR1 multi-fidelity GP with Matérn-5/2 kernel and sparse discrepancy GP (inducing points=15) in GPyTorch or Emukit. Perform Bayesian inversion with NUTS (PyMC/NumPyro) using the surrogate likelihood. Compute 95% CI widths for source release rate and reaction rate, compare to single-fidelity GP inversion at equal budget (N_high=20). Compute EIG via nested Monte Carlo (inner=500, outer=200) on both surrogate and high-fidelity for 50 candidate monitoring designs (varying n_wells 5-50, ℓ_obs 0-10 km). Run 100 synthetic scenarios with paired bootstrap and Wilcoxon signed-rank tests. Profile likelihood curvature computed for discrepancy parameters. Coverage assessed on 1000 held-out test points with correlated errors.

- Cout: €500-2000 (cloud compute + personnel time)
- Duree: 4-8 weeks
- Equipement: HPC cluster node (≥32 cores, 128 GB RAM) or cloud equivalent (AWS c6i.8xlarge)
- Logiciels: PFLOTRAN or MODFLOW/MT3DMS, GPyTorch or Emukit, PyMC or NumPyro (NUTS), scikit-learn (LHS, bootstrap), SALib (sensitivity), Python 3.11 + Jupyter

**Criteres de succes :**

- Median reduction in 95% CI width for source release rate: ≥40% (95% CI [35%,45%])
- Pearson r between surrogate EIG and high-fidelity EIG: ≥0.85 (95% CI [0.80,0.90])
- Profile likelihood curvature for discrepancy parameters: >0.1 in ≥90% of 100 scenarios
- Predictive coverage of 95% intervals: Between 93% and 97%

- **GO**: CI width reduction ≥35% AND Pearson r ≥0.80 AND discrepancy curvature >0.1 in ≥85% scenarios. Proceed to Phase 2 with the validated surrogate architecture.
- **NO-GO**: CI width reduction <20% OR Pearson r <0.70 OR discrepancy curvature <0.1 in >30% scenarios. Hypothesis falsified in silico; abandon or reformulate.
- **PIVOT**: CI width reduction 20-35% OR Pearson r 0.70-0.80. Pivot to alternative surrogate (e.g., deep kernel learning, PCA-based multi-fidelity) or reduce scope to EIG-only validation.

### 4.2 Phase 2 — Minimal Experimental Validation

**Objectif**: Validate the multi-fidelity surrogate and EIG correlation on a physical laboratory-scale reactive transport experiment with known source and controlled monitoring, confirming the mechanism central to the hypothesis.

**Methodologie**: Design a bench-scale 2D flow cell (1.2 m x 0.6 m x 0.05 m) packed with homogeneous sand, with a controlled contaminant source (e.g., bromide tracer + reactive compound such as acetate or nitrate) injected at a known rate. Install 12-20 sampling ports along the flow path. Run 10-15 high-fidelity experiments (full tracer + reactive transport) and 100+ low-fidelity experiments (tracer-only or simplified chemistry, faster). Measure breakthrough curves at ports. Calibrate high-fidelity model (PFLOTRAN) to experimental data; calibrate low-fidelity model (coarse-grid or simplified kinetics). Train multi-fidelity GP on experimental + synthetic data. Perform Bayesian inversion for source release rate and reaction rate. Compute CI widths and compare to single-fidelity inversion. Compute EIG for candidate port configurations and compare surrogate vs high-fidelity nested MC. Assess coverage of predictive intervals.

- Cout: €8k-15k (flow cell, sensors, reagents, personnel)
- Duree: 2-3 months
- Equipement: 2D flow cell (1.2m x 0.6m x 0.05m) with sand packing, Peristaltic pump (Masterflex) for controlled injection, Inline UV-Vis or conductivity sensors (12-20 ports), Fraction collector or automated sampling system, Tracer compounds (bromide, acetate/nitrate) and reagents
- Logiciels: PFLOTRAN or MODFLOW/MT3DMS, GPyTorch/Emukit, PyMC/NumPyro, Python data pipeline (pandas, xarray)

**Criteres de succes :**

- Median reduction in 95% CI width for source release rate: ≥30% (relaxed from 40% due to experimental noise)
- Pearson r between surrogate EIG and high-fidelity EIG: ≥0.80
- Predictive coverage of 95% intervals: Between 90% and 98%
- Posterior mean error for reaction rate constant: ≤15% of true value

- **GO**: CI width reduction ≥25% AND Pearson r ≥0.75 AND coverage in [90%,98%]. Proceed to Phase 3 with field-scale design.
- **NO-GO**: CI width reduction <15% OR Pearson r <0.65 OR coverage outside [85%,99%]. Hypothesis not supported experimentally; pivot to alternative surrogate or abandon.
- **PIVOT**: CI width reduction 15-25% OR Pearson r 0.65-0.75. Pivot to hybrid approach (e.g., multi-fidelity + physics-informed neural network) or restrict to EIG validation only.

### 4.3 Phase 3 — Full Experimental Protocol

**Objectif**: Rigorous field-scale validation of multi-fidelity Bayesian inversion for source attribution and information-optimal monitoring design, producing a publishable result with real-world complexity (heterogeneity, sparse wells, correlated errors).

**Methodologie**: Select a well-characterized contaminated site (e.g., a controlled release test site or a legacy contaminated aquifer with known source history). Deploy a monitoring network of 20-50 wells with multilevel samplers. Conduct a controlled tracer/reactive injection experiment (or use existing long-term monitoring data). Collect high-fidelity data (full suite of geochemical parameters, 50-100 sampling events) and low-fidelity data (simplified parameters, 500+ events). Build high-fidelity reactive transport model (PFLOTRAN, 3D, heterogeneous permeability field from geophysics) and low-fidelity model (coarse-grid, simplified reactions). Train multi-fidelity GP on field data. Perform Bayesian inversion for source release rate, reaction rate, and discrepancy parameters. Compute EIG for candidate monitoring designs (well placement, sampling frequency) and validate against high-fidelity nested Monte Carlo. Assess CI width reduction, EIG correlation, coverage, and robustness to structural error (omitted reactions). Publish protocol, data, and code.

- Cout: €50k-200k (field operations, drilling, analysis, personnel)
- Duree: 12-18 months
- Equipement: 20-50 monitoring wells with multilevel samplers, Field injection system (pumps, tanks, tracer/reactive compounds), Field analytical lab (IC, HPLC, UV-Vis, field probes), Geophysical survey equipment (ERT, GPR) for permeability characterization, Data loggers and telemetry for continuous monitoring
- Logiciels: PFLOTRAN or MODFLOW/MT3DMS (3D reactive transport), GPyTorch/Emukit (multi-fidelity GP), PyMC/NumPyro (Bayesian inversion), SALib (sensitivity), Python/R for statistical analysis

**Criteres de succes :**

- Median reduction in 95% CI width for source release rate: ≥40% (95% CI [30%,50%])
- Pearson r between surrogate EIG and high-fidelity EIG: ≥0.85
- Predictive coverage of 95% intervals: Between 93% and 97%
- Posterior mean error for reaction rate constant: ≤10% of true value (if known) or ≤20% of lab-derived value
- Discrepancy term identifiability: Profile likelihood curvature >0.1 for all parameters

- **GO**: CI width reduction ≥30% AND Pearson r ≥0.80 AND coverage in [92%,98%] AND discrepancy curvature >0.1. Hypothesis validated; publish and recommend for operational use.
- **NO-GO**: CI width reduction <20% OR Pearson r <0.70 OR coverage outside [90%,99%]. Hypothesis falsified at field scale; publish negative result and recommend alternative approaches.
- **PIVOT**: CI width reduction 20-30% OR Pearson r 0.70-0.80. Pivot to hybrid multi-fidelity + deep learning surrogate or restrict to specific site conditions; publish with caveats.

### 4.4 Quick start : comment demarrer aujourd'hui

- **Peut demarrer maintenant**: Oui
- **Premiere action**: Clone the PFLOTRAN reactive transport benchmark (e.g., 2D advection-dispersion with first-order degradation) and set up a coarse-grid low-fidelity version in the same directory. Run 10 high-fidelity and 100 low-fidelity simulations with a Latin Hypercube sample of source release rate and reaction rate.
- **Outils**: PFLOTRAN (or MODFLOW/MT3DMS), Python 3.11, GPyTorch or Emukit, scikit-learn, PyMC or NumPyro
- **Donnees ouvertes**: PFLOTRAN benchmark suite (https://www.pflotran.org), MODFLOW/MT3DMS examples (USGS), Hydrogeological synthetic benchmarks (e.g., Borden aquifer, HMIP)

## 5. Analyse d'impact

### 5.1 Impact scientifique

Novelty score: 0.72/1.0 (incremental)

### 5.2 Applications industrielles et marche

**Score industriel**: 6.5/10

**Forces :**
- Le marché de la caractérisation des sites pollués est en croissance structurelle : en Europe, la directive IED et le règlement sur les polluants organiques persistants imposent des obligations de surveillance et d'attribution de sources. Le marché mondial de la remédiation des eaux souterraines est estimé à 8-12 Md€/an, dont 15-20 % consacrés à la caractérisation et à la modélisation. Des acteurs comme Arcadis, Ramboll, Jacobs et Suez Consulting dépensent des dizaines de millions d'euros par an en études de transport réactif pour des sites industriels (anciennes cokeries, usines chimiques, sites miniers). Un outil réduisant de 40 % l'incertitude sur les paramètres de source permettrait de réduire les coûts de remédiation de 20-30 % en évitant les surdimensionnements de barrières hydrauliques ou de pompage-traitement.
- L'avantage compétitif réside dans l'intégration de l'EIG (Expected Information Gain) avec un surrogate multi-fidélité : cela permet de concevoir des campagnes de surveillance optimales (nombre et position des puits) avant tout forage, ce qui est un argument commercial fort face aux méthodes classiques (essais-erreurs, modèles single-fidelity coûteux). Les concurrents (GMS, FEFLOW, MODFLOW) n'ont pas cette capacité native d'optimisation bayésienne de l'information. Une start-up ou un bureau d'études pourrait vendre cela comme un service à forte valeur ajoutée (10-50 k€ par site) avec une marge élevée.
- La propriété intellectuelle potentielle est réelle : l'architecture AR1 non-linéaire pour le transport réactif, couplée à l'EIG sur surrogate, peut faire l'objet de brevets logiciels (en Europe, moins protecteurs qu'aux États-Unis) ou de secrets industriels. Les codes de calcul (Gaussian process, inversion bayésienne) sont ouverts, mais l'implémentation spécifique pour le transport réactif avec attribution de source est différenciante.

**Faiblesses :**
- La barrière à l'entrée est faible en théorie mais forte en pratique : les modèles de transport réactif (PHREEQC, PHT3D, CrunchFlow) sont complexes, et leur couplage avec des GP multi-fidélité nécessite une expertise rare (à l'intersection de l'hydrogéologie, des statistiques bayésiennes et du machine learning). Le recrutement de ces profils est difficile et coûteux (150-250 k€/an en Europe). De plus, les clients (bureaux d'études, industriels) sont conservateurs et peu enclins à adopter des méthodes non validées par des décennies de pratique.
- Le ROI est incertain : le budget de 18-120 k€ pour la validation est faible, mais le passage à l'échelle industrielle nécessite des investissements en logiciel (développement, maintenance, support) et en acquisition de données (forages, capteurs). Le cycle de vente est long (12-24 mois) car les décisions d'investissement dans la remédiation impliquent des régulateurs et des assureurs. Le marché adressable initial est limité aux sites à fort enjeu (grands industriels, sites orphelins), soit peut-être 500-1000 sites en Europe, ce qui plafonne le chiffre d'affaires à quelques millions d'euros par an pour un acteur spécialisé.
- La concurrence existante est indirecte mais réelle : les grands bureaux d'études utilisent déjà des méthodes bayésiennes (par exemple, le logiciel MADS de l'USGS, ou des approches d'assimilation de données). De plus, les modèles single-fidelity restent la norme car ils sont plus simples à justifier réglementairement. Sans un cas d'usage démontré à grande échelle, l'adoption restera marginale. Enfin, la prédiction 5 (erreur structurelle) est un risque majeur : si le modèle high-fidelity omet une réaction secondaire, la correction de biais peut être insuffisante, ce qui limiterait la crédibilité en conditions réelles.

**Recommandation**: Je recommande une stratégie de niche : cibler d'abord les grands industriels (Total, Solvay, ArcelorMittal) et les gestionnaires de sites orphelins (ADEME) avec un service pilote à 50-80 k€ par site, incluant la conception optimale de surveillance et l'attribution de source. En parallèle, nouer un partenariat avec un éditeur de logiciel hydrogéologique (par exemple, DHI ou Rockware) pour intégrer le surrogate multi-fidélité dans une suite existante, plutôt que de développer un produit standalone. La commercialisation à grande échelle ne sera réaliste qu'après 3-4 ans de validation terrain et une acceptation réglementaire progressive ; d'ici là, le chiffre d'affaires restera confidentiel (<5 M€/an).

### 5.3 Opportunites de financement

| Programme | Agence | Fit | Budget type | Taux succes |
|-----------|--------|-----|-------------|-------------|
| ERC Starting Grant 2026 | European Research Council | 0.9 | 1,5 M€ - 2,5 M€ sur 5 ans | environ 12-15% |
| ANR PRC (Projet de Recherche Collaborative) 2026 | Agence Nationale de la Recherche | 0.85 | 300 k€ - 600 k€ sur 3-4 ans | environ 20-25% |
| Horizon Europe Cluster 6 - Appel « Water and marine environment » (HORIZON-CL6-2026-OCEAN-01) | European Commission | 0.75 | 3 M€ - 5 M€ sur 3-4 ans (projet collaboratif) | environ 15-20% |

- **ERC Starting Grant 2026** (European Research Council): L'ERC Starting Grant finance des projets de recherche fondamentale à haut risque et à fort potentiel, portés par un chercheur en début de carrière. L'hypothèse propose une avancée méthodologique significative (surrogate multi-fidélité pour l'inversion bayésienne en transport réactif) avec des applications sociétales majeures. Le budget demandé dans le protocole (18k-120k€) est bien inférieur au plafond ERC, mais le projet pourrait être élargi pour inclure des développements théoriques plus profonds et des validations multi-échelles. L'ERC valorise l'originalité et la prise de risque, ce qui correspond à l'approche multi-fidélité et à l'objectif de réduction de 40% de l'incertitude.
- **ANR PRC (Projet de Recherche Collaborative) 2026** (Agence Nationale de la Recherche): L'ANR PRC finance des projets collaboratifs entre laboratoires publics et éventuellement des partenaires industriels. L'hypothèse nécessite une validation expérimentale en laboratoire et sur le terrain, ce qui requiert une équipe pluridisciplinaire (mathématiques appliquées, hydrogéologie, génie des procédés). Le budget demandé (18k-120k€) est modeste pour l'ANR, mais le projet pourrait être élargi pour inclure plusieurs partenaires et des expériences à plus grande échelle. L'ANR apprécie les projets avec des critères de succès clairs et une gestion des risques (GO/NO-GO), ce qui est le cas ici. De plus, la thématique de la gestion des eaux souterraines est une priorité de l'ANR.
- **Horizon Europe Cluster 6 - Appel « Water and marine environment » (HORIZON-CL6-2026-OCEAN-01)** (European Commission): Cet appel finance des projets collaboratifs visant à protéger et restaurer les écosystèmes aquatiques, y compris les eaux souterraines. L'hypothèse s'inscrit dans cette priorité en améliorant l'attribution des sources de contamination et la conception de réseaux de surveillance optimaux. Le TRL actuel (2-3) est faible pour Horizon Europe, qui attend souvent des TRL plus élevés (4-6) en fin de projet. Cependant, le projet pourrait être structuré pour inclure des partenaires industriels et des agences de l'eau, et viser une montée en TRL jusqu'à 5-6. Le budget demandé serait alors bien plus élevé (3-5 M€), mais le consortium devrait être élargi. La réussite dépendrait de la capacité à démontrer un impact sociétal et économique clair.

**Recommandation financement**: Je recommande de cibler en priorité l'appel ERC Starting Grant 2026 pour la composante fondamentale (développement méthodologique et validation en laboratoire), et de soumettre en parallèle une proposition à l'ANR PRC pour la phase terrain avec un consortium incluant un hydrogéologue de terrain et un partenaire industriel. Une alternative serait le programme Horizon Europe Cluster 6 (appel « Water and marine environment ») pour un projet collaboratif à plus grande échelle, mais le TRL actuel nécessite d'abord une preuve de concept solide.

## 6. Panel Review Summary

| Reviewer | Score | Verdict | Point cle |
|----------|-------|---------|-----------|
| methodologist | 6.5/10 | weak_accept | Le protocole est structuré en trois phases (in silico, laboratoire, terrain) avec des critères GO/NO-GO/PIVOT explicites et des seuils quantitatifs, ce qui limite les décisions post-hoc et favorise la reproductibilité. |
| domain_expert | 6.2/10 | weak_accept | L'hypothèse s'appuie sur un socle méthodologique solide et bien identifié : le chaînage AR1 de Kennedy & O'Hagan (2000) est le standard de facto pour les GP multi-fidélité, et son transfert à l'inversion bayésienne en transport réactif constitue une extension non triviale mais crédible. Le mécanisme proposé (basse fidélité pour la structure globale du postérieur, haute fidélité pour corriger le biais local) est cohérent avec la décomposition biais-variance classique des surrogates multi-niveaux. |
| contrarian | 4.2/10 | weak_reject | L'architecture multi-fidélité AR1 est un cadre établi et le couplage avec l'inversion bayésienne pour l'attribution de source est une piste pertinente, rarement testée sur des scénarios de transport réactif réalistes. |
| industrialist | 6.5/10 | weak_accept | Le marché de la caractérisation des sites pollués est en croissance structurelle : en Europe, la directive IED et le règlement sur les polluants organiques persistants imposent des obligations de surveillance et d'attribution de sources. Le marché mondial de la remédiation des eaux souterraines est estimé à 8-12 Md€/an, dont 15-20 % consacrés à la caractérisation et à la modélisation. Des acteurs comme Arcadis, Ramboll, Jacobs et Suez Consulting dépensent des dizaines de millions d'euros par an en études de transport réactif pour des sites industriels (anciennes cokeries, usines chimiques, sites miniers). Un outil réduisant de 40 % l'incertitude sur les paramètres de source permettrait de réduire les coûts de remédiation de 20-30 % en évitant les surdimensionnements de barrières hydrauliques ou de pompage-traitement. |
| funding_strategist | 7.5/10 | accept | L'hypothèse est falsifiable et quantifiée (réduction de 40% de la largeur de l'intervalle de crédibilité, corrélation r≥0.85), ce qui répond aux critères de rigueur attendus par les financeurs européens et facilite l'évaluation par les pairs. |

**Consensus score**: 6.2/10
**Verdict final**: publish_brief

### 6.1 Consensus

- Le protocole est structuré en trois phases avec des critères GO/NO-GO et des seuils quantitatifs, ce qui favorise la reproductibilité et limite les décisions post-hoc.
- L'utilisation de l'EIG sur un surrogate multi-fidélité pour l'optimisation de designs de monitoring est un objectif appliqué crédible et original, à condition de contrôler le biais du surrogate.
- Les prédictions sont falsifiables avec des bornes numériques explicites (réduction de 40% de l'IC, r ≥ 0.85), ce qui facilite l'évaluation indépendante.

### 6.2 Points de desaccord

- Le methodologist et le domain_expert considèrent que l'absence de calcul de puissance statistique et de contrôles négatifs est une faiblesse majeure, tandis que le funding_strategist juge le protocole suffisamment rigoureux pour un financement.
- Le contrarian affirme que l'hypothèse de corrélation ρ ≥ 0.5 n'est ni démontrée ni testée pour un transport réactif non linéaire, alors que le domain_expert la considère comme plausible mais non étayée théoriquement.
- L'industrialist estime que le marché est prometteur mais que l'adoption réglementaire et le conservatisme des bureaux d'études limitent l'impact, tandis que le funding_strategist voit un fort alignement avec les priorités du Green Deal.

### 6.3 Critical path

La démonstration empirique que la corrélation rang ρ ≥ 0.5 tient pour un modèle de transport réactif non linéaire avec des raideurs numériques différentes, et que le terme de discrépance δ(x) reste identifiable à N_high = 20 sans produire d'intervalles de crédibilité sur-confiants.

**Recommandation finale**: Le panel reconnaît l'originalité et la pertinence du couplage multi-fidélité–inversion bayésienne–EIG pour l'attribution de source en transport réactif, ainsi que la qualité de la structuration en phases. Cependant, des verrous méthodologiques majeurs subsistent : absence de calcul de puissance, non-identifiabilité potentielle de δ(x), biais non quantifié de l'EIG sur surrogate, et risque de sur-confiance. En l'état, l'hypothèse reste une conjecture plausible mais non testée, et les prédictions 1, 3 et 5 sont à haut risque de faux positifs. Le panel recommande de rejeter la version actuelle et d'encourager une reformulation ultérieure intégrant les contrôles et analyses manquants.

## 7. Gap Manifest residuel

### 7.1 Data gaps

- No paper in the list demonstrates multi-fidelity Bayesian inversion specifically for reactive transport with geochemical speciation — the closest (930a0e66) uses single-fidelity Kriging surrogates.
- No paper in the list addresses fusion of geophysical, geochemical, and remote sensing data within a single Bayesian framework for groundwater quality.
- No paper in the list demonstrates expected-information-gain-based optimal design of groundwater quality monitoring networks coupled with multi-fidelity surrogates.
- No paper in the list provides statistical guarantees (e.g., posterior contraction rates) for multi-fidelity Bayesian inversion in the presence of model discrepancy between fidelity levels.

### 7.2 Competence gaps

- Phase 1: Reactive transport modeling
- Phase 1: Gaussian process regression
- Phase 1: Bayesian inference / MCMC
- Phase 1: Optimal experimental design
- Phase 2: Column/flow cell experimentation
- Phase 2: Reactive transport modeling
- Phase 2: Bayesian inference
- Phase 2: Sensor calibration
- Phase 3: Field hydrogeology
- Phase 3: Reactive transport modeling
- Phase 3: Bayesian inference and MCMC
- Phase 3: Optimal experimental design
- Phase 3: Geostatistics

### 7.3 Epistemic gaps

- Whether the discrepancy term remains identifiable at N_high = 20 when the low-fidelity model has a rank inversion (i.e., the low-fidelity model is more accurate in some regions than the high-fidelity model).
- The magnitude of the outer-loop bias in EIG estimation when using a surrogate, and whether it can be corrected by a control variate or importance sampling.
- The impact of spatially correlated observation errors on the predictive coverage of the multi-fidelity posterior.
- Whether the multi-fidelity GP can handle structural model error (e.g., omitted reaction pathways) without overfitting the discrepancy term.

## References

[1] Jun Zhou, Xiao-Si Su, et al. (2018). *An adaptive Kriging surrogate method for efficient joint estimation of hydraulic and biochemical parameters in reactive transport modeling.*. DOI: [10.1016/j.jconhyd.2018.08.005](https://doi.org/10.1016/j.jconhyd.2018.08.005)
[2] R. Sprocati, Massimo Rolle (2021). *Integrating Process‐Based Reactive Transport Modeling and Machine Learning for Electrokinetic Remediation of Contaminated Groundwater*. DOI: [10.1029/2021WR029959](https://doi.org/10.1029/2021WR029959)
[3] Kislaya Ravi, Vladyslav Fediukov, et al. (2024). *Multi-fidelity Gaussian process surrogate modeling for regression problems in physics*. DOI: [10.1088/2632-2153/ad7ad5](https://doi.org/10.1088/2632-2153/ad7ad5)
[4] Ke Li, Fan Li (2024). *Multi-Fidelity Methods for Optimization: A Survey*. DOI: [10.1145/3801959](https://doi.org/10.1145/3801959)
[5] Xun Huan, Jayanth Jagalur, et al. (2024). *Optimal experimental design: Formulations and computations*. DOI: [10.1017/S0962492924000023](https://doi.org/10.1017/S0962492924000023)
[6] A. Attia, E. Constantinescu (2020). *Optimal Experimental Design for Inverse Problems in the Presence of Observation Correlations*. DOI: [10.1137/21m1418666](https://doi.org/10.1137/21m1418666)
[7] W. Nowak, A. Guthke (2016). *Entropy-Based Experimental Design for Optimal Model Discrimination in the Geosciences*. DOI: [10.3390/E18110409](https://doi.org/10.3390/E18110409)
[8] Y. Gan, Xin-Zhong Liang, et al. (2018). *A systematic assessment and reduction of parametric uncertainties for a distributed hydrological model*. DOI: [10.1016/J.JHYDROL.2018.07.055](https://doi.org/10.1016/J.JHYDROL.2018.07.055)
[9] Rui Xu, Dongxiao Zhang, et al. (2021). *Uncertainty quantification and inverse modeling for subsurface flow in 3D heterogeneous formations using a theory-guided convolutional encoder-decoder network*. DOI: [10.1016/j.jhydrol.2022.128321](https://doi.org/10.1016/j.jhydrol.2022.128321)
[10] Liu Yang, Xuhui Meng, et al. (2020). *B-PINNs: Bayesian Physics-Informed Neural Networks for Forward and Inverse PDE Problems with Noisy Data*. DOI: [10.1016/j.jcp.2020.109913](https://doi.org/10.1016/j.jcp.2020.109913)
[11] François Monard, Richard Nickl, et al. (2020). *Statistical guarantees for Bayesian uncertainty quantification in nonlinear inverse problems with Gaussian process priors*. DOI: [10.1214/21-aos2082](https://doi.org/10.1214/21-aos2082)
[12] I. Sahin, Christian Moya, et al. (2023). *Deep Operator Learning-based Surrogate Models with Uncertainty Quantification for Optimizing Internal Cooling Channel Rib Profiles*. DOI: [10.48550/arXiv.2306.00810](https://doi.org/10.48550/arXiv.2306.00810)
[13] Marjuka Ferdousi Lazin, Christian R Shelton, et al. (2023). *High-dimensional multi-fidelity Bayesian optimization for quantum control*. DOI: [10.1088/2632-2153/ad0100](https://doi.org/10.1088/2632-2153/ad0100)
[14] Jing-Wen Zeng, Kai Liu, et al. (2024). *Driving factor, source identification, and health risk of PFAS contamination in groundwater based on the self-organizing map.*. DOI: [10.1016/j.watres.2024.122458](https://doi.org/10.1016/j.watres.2024.122458)
[15] Xiao Yang, Jiayi Du, et al. (2024). *Unravelling integrated groundwater management in pollution-prone agricultural cities: A synergistic approach combining probabilistic risk, source apportionment and artificial intelligence.*. DOI: [10.1016/j.jhazmat.2024.136514](https://doi.org/10.1016/j.jhazmat.2024.136514)
[16] Ziyue Yin, Jian-Feng Wu, et al. (2022). *Multi-objective optimization-based reactive nitrogen transport modeling for the water-environment-agriculture nexus in a basin-scale coastal aquifer.*. DOI: [10.1016/j.watres.2022.118111](https://doi.org/10.1016/j.watres.2022.118111)
[17] Suraj Kumar, N. S. Maurya (2025). *Analysis of heavy metal contamination in groundwater and associated probabilistic human health risk assessment using Monte Carlo simulation: A case study in Gaya, Bihar.*. DOI: [10.2166/wh.2025.348](https://doi.org/10.2166/wh.2025.348)
[18] Hongxia Hu, Hongguang Zheng, et al. (2024). *Heavy Metal Contamination Assessment and Source Attribution in the Vicinity of an Iron Slag Pile in Hechi, China: Integrating Multi-Medium Analysis.*. DOI: [10.1016/j.envres.2024.120206](https://doi.org/10.1016/j.envres.2024.120206)

## Annexes

### A. Detailed Reviewer Reports

#### Methodologist

- **Score**: 6.5/10 | **Verdict**: weak_accept | **Confidence**: 0.85
- **Strengths**: Le protocole est structuré en trois phases (in silico, laboratoire, terrain) avec des critères GO/NO-GO/PIVOT explicites et des seuils quantitatifs, ce qui limite les décisions post-hoc et favorise la reproductibilité.; L'utilisation de scénarios synthétiques avec vérité connue (100 scénarios en Phase 1) permet de quantifier les biais et la couverture des intervalles de crédibilité, et de tester la robustesse à l'erreur structurelle (prédiction 5).; Les hypothèses falsifiables sont associées à des bornes numériques et des méthodes statistiques adaptées (bootstrap apparié, Wilcoxon, courbure de vraisemblance profilée), ce qui facilite l'évaluation indépendante.; La prise en compte de la corrélation spatiale des erreurs d'observation (ℓ_obs) et l'évaluation de la couverture prédictive sont des points méthodologiquement avancés, souvent négligés dans les études de transport réactif.; Le plan de gestion des risques identifie des menaces crédibles (inversion de rang, non-identifiabilité du terme d'écart, coût du Monte Carlo imbriqué) et propose des pivots, ce qui renforce la robustesse globale.
- **Weaknesses**: La justification de la taille d'échantillon est absente : aucun calcul de puissance statistique n'est fourni pour les tests principaux (par exemple, détecter une réduction de 40% de la largeur de l'IC avec 100 scénarios), ce qui rend incertaine la capacité à conclure en cas d'effet modéré.; Le critère de réduction de 40% de la largeur de l'IC est défini par rapport à une inversion mono-fidélité à budget computationnel égal, mais le budget est fixé à N_high=20 et N_low=1000 sans analyse de sensibilité à ces valeurs ; or la performance relative dépend fortement de l'allocation et du coefficient de corrélation ρ.; La métrique de courbure de vraisemblance profilée pour l'identifiabilité du terme d'écart δ(x) est définie sur une échelle normalisée sans préciser la normalisation, ce qui rend le seuil >0,1 difficile à interpréter et potentiellement non reproductible.; Le protocole ne décrit pas de contrôles négatifs ou de tests de spécificité : par exemple, une inversion mono-fidélité avec un noyau plus flexible, ou un modèle multi-fidélité avec ρ fixé à 1 (dégénéré), pour vérifier que l'amélioration n'est pas due à une simple augmentation de la flexibilité du surrogate.; Les risques de biais de confirmation et de sélection ne sont pas adressés : les scénarios synthétiques sont générés par le même modèle que celui utilisé pour l'inversion, ce qui peut favoriser la méthode multi-fidélité ; aucun test avec un modèle générateur différent (par exemple, réactions non linéaires) n'est prévu en Phase 1.; La corrélation entre l'EIG surrogate et l'EIG haute-fidélité est évaluée sur 50 designs, mais la puissance pour détecter r≥0,85 contre r≤0,70 n'est pas calculée ; de plus, l'EIG de référence par Monte Carlo imbriqué (inner=500, outer=200) peut être bruité, ce qui atténue artificiellement la corrélation et menace la validité du critère.; En Phase 3, l'utilisation d'un site contaminé réel avec historique inconnu rend la vérité terrain inaccessible pour le taux de libération, ce qui empêche de vérifier directement la réduction de l'IC et le biais du posterior mean ; le protocole ne propose pas de validation croisée avec des données de forage ou des traceurs indépendants.
- **Questions**: Quel est le calcul de puissance statistique pour le test principal (réduction médiane de 40% de la largeur de l'IC) avec 100 scénarios synthétiques, en supposant une variabilité inter-scénarios réaliste ? Quelle est la probabilité de détecter un effet de 30% si la vraie réduction est de 30% ?; Comment le protocole contrôle-t-il le biais de confirmation dans la Phase 1, sachant que les données synthétiques sont générées par le même modèle de transport réactif que celui utilisé pour l'inversion ? Un test avec un modèle générateur alternatif (par exemple, cinétique de Monod ou transport non-Fickien) est-il prévu ?; La courbure de vraisemblance profilée pour δ(x) est-elle invariante à l'échelle ? Quelle normalisation exacte est utilisée, et comment le seuil de 0,1 a-t-il été calibré ? Une analyse de sensibilité à la paramétrisation du GP d'écart (nombre de points induits, noyau) est-elle planifiée ?; Quels contrôles négatifs sont inclus pour exclure que l'amélioration de la réduction de l'IC provienne simplement d'une plus grande flexibilité du modèle multi-fidélité plutôt que de l'exploitation de la corrélation entre fidélités ?; Comment la couverture prédictive est-elle évaluée en Phase 3 sur le terrain, où la vérité terrain est inconnue ? Le protocole prévoit-il des points de validation indépendants (par exemple, des forages de contrôle non utilisés dans l'inversion) pour estimer la couverture ?; Le bruit du Monte Carlo imbriqué pour l'EIG haute-fidélité est-il quantifié et corrigé (par exemple, par une correction d'atténuation) ? Sans cela, la corrélation de Pearson entre EIG surrogate et EIG haute-fidélité peut être sous-estimée, ce qui menace la falsifiabilité de la prédiction 3.
- **Recommendation**: Le protocole est ambitieux et méthodologiquement riche, avec des critères falsifiables et une structure par phases qui limite les décisions arbitraires. Cependant, l'absence de calcul de puissance statistique, de contrôles négatifs et de gestion explicite du biais de confirmation affaiblit la validité interne. Je recommande une révision majeure avant acceptation : ajouter une analyse de puissance pour les tests principaux, inclure des contrôles avec un modèle générateur alternatif et des surrogates dégénérés, et préciser la normalisation de la courbure de vraisemblance profilée. En l'état, l'hypothèse est plausible mais la rigueur méthodologique reste insuffisante pour garantir la reproductibilité et la robustesse des conclusions.

#### Domain Expert

- **Score**: 6.2/10 | **Verdict**: weak_accept | **Confidence**: 0.78
- **Strengths**: L'hypothèse s'appuie sur un socle méthodologique solide et bien identifié : le chaînage AR1 de Kennedy & O'Hagan (2000) est le standard de facto pour les GP multi-fidélité, et son transfert à l'inversion bayésienne en transport réactif constitue une extension non triviale mais crédible. Le mécanisme proposé (basse fidélité pour la structure globale du postérieur, haute fidélité pour corriger le biais local) est cohérent avec la décomposition biais-variance classique des surrogates multi-niveaux.; L'articulation entre inversion bayésienne multi-fidélité et OED via l'EIG est pertinente et bien positionnée : la littérature OED récente (Huan et al. 2024) reconnaît explicitement que l'estimation de l'EIG sur surrogate est un problème ouvert, et l'hypothèse attaque précisément ce verrou avec un critère de validation quantitatif (Pearson r ≥ 0.85).; La base bibliographique couvre correctement les trois piliers (surrogates en transport réactif, GP multi-fidélité, OED) et identifie honnêtement les travaux les plus proches (Zhou et al. 2018 pour le surrogate Kriging en transport réactif, Ravi et al. 2024 pour le GP multi-fidélité en physique). Le novelty assessment est lucide sur le caractère incrémental de la contribution.; Les hypothèses clés sont explicitées avec des seuils testables (ρ ≥ 0.5, N_high = 20, Matérn kernel, erreurs log-transformées hétéroscédastiques), ce qui rend l'hypothèse falsifiable — un point fort méthodologique trop rare dans les propositions de ce type.
- **Weaknesses**: Le seuil quantitatif « réduction ≥ 40 % de la largeur de l'IC à 95 % à budget computationnel égal » n'est ni dérivé ni justifié théoriquement. Il dépend de manière critique du ratio de coût entre niveaux de fidélité, de la corrélation ρ effective, et de la dimension du paramètre d'inversion. Aucune analyse de sensibilité ni borne théorique (par ex. via la décomposition de la variance postérieure ou les résultats de Peherstorfer et al. sur les taux de convergence multi-fidélité) n'est fournie pour étayer ce chiffre.; Le mécanisme de correction du biais par le terme de discrépance δ(x) est présenté comme « sparse GP avec prior informatif », mais rien ne garantit que δ(x) soit identifiable à N_high = 20 lorsque la basse fidélité présente une inversion de rang (le point est d'ailleurs listé comme « known unknown »). Or, en inversion bayésienne, la non-identifiabilité de δ se propage directement dans le postérieur des paramètres de source, ce qui peut produire des IC artificiellement étroits (overconfidence) plutôt que la réduction souhaitée. C'est un risque structurel non traité.; L'affirmation « l'EIG calculé sur le surrogate est un estimateur non biaisé de l'EIG haute fidélité lorsque le surrogate est bien calibré » est incorrecte en général. L'EIG est une fonctionnelle non linéaire du postérieur (espérance d'une divergence KL), et l'espérance d'une fonction non linéaire d'un surrogate n'est pas égale à la fonctionnelle du modèle vrai. Un biais de boucle externe (outer-loop bias) subsiste même avec un surrogate parfaitement calibré au sens de la couverture prédictive. La correction par variable de contrôle ou importance sampling est mentionnée mais non quantifiée, et le seuil r ≥ 0.85 masque potentiellement un biais systématique corrélé.; La gestion des erreurs d'observation spatialement corrélées et hétéroscédastiques (Matérn avec longueur de corrélation et variance inconnues) est un problème d'identifiabilité notoirement difficile (cf. Zhang 2004, et plus récemment les travaux de Bui-Thanh sur les covariances hyperparamétriques). L'hypothèse ne discute pas comment ces hyperparamètres interagissent avec le terme de discrépance δ(x) — les deux peuvent absorber des structures similaires, créant une dégénérescence entre erreur de modèle et erreur d'observation.; Le positionnement par rapport à la littérature multi-fidélité en inversion bayésienne est incomplet : les travaux de Peherstorfer, Willcox & Gunzburger (SIAM Review 2018), de Perdikaris et al. (2017) sur les GP multi-fidélité non linéaires, et surtout les contributions sur l'inversion bayésienne multi-fidélité (par ex. les travaux de Goh, Bingham, Holloway sur MF-MCMC, et plus récemment les approches de multi-fidélité pour les EDP inverses de Biehler, Janz, etc.) ne sont pas cités alors qu'ils constituent l'état de l'art direct. La revue de Huan et al. 2024 est citée mais l'usage qui en est fait reste générique.
- **Questions**: Comment le seuil de réduction de 40 % de la largeur de l'IC à 95 % est-il dérivé ? Peut-on fournir une borne théorique (par ex. via la décomposition de la variance postérieure en contributions basse et haute fidélité, ou via les taux de convergence multi-fidélité de Peherstorfer et al.) qui relie ce chiffre au ratio de coût N_low/N_high, à ρ, et à la dimension du paramètre ?; Quelle est la stratégie concrète pour garantir l'identifiabilité du terme de discrépance δ(x) lorsque la basse fidélité présente une inversion de rang ? Un prior informatif sur δ ne résout pas le problème si la vraisemblance est plate dans la direction correspondante — comment le mécanisme évite-t-il que δ absorbe le signal de source et produise des IC sur-confiantes ?; L'affirmation d'estimateur non biaisé de l'EIG haute fidélité est-elle défendable ? Si non, quelle est la magnitude attendue du biais de boucle externe en fonction de la qualité du surrogate (par ex. en termes de divergence KL entre postérieurs basse et haute fidélité), et la correction par variable de contrôle réduit-elle ce biais en dessous du seuil de r ≥ 0.85 ?; Comment les hyperparamètres de la covariance d'erreur d'observation (longueur de corrélation, variance, hétéroscédasticité) sont-ils distingués du terme de discrépance δ(x) ? Existe-t-il une analyse d'identifiabilité conjointe, ou une stratégie de reparamétrisation (par ex. marginalisation, priors hiérarchiques) qui empêche la dégénérescence entre erreur de modèle et erreur de mesure ?; Le scénario de validation « modèle haute fidélité structurellement correct (pas de voie réactionnelle manquante) » est-il représentatif ? Si l'objectif est la source attribution en conditions réelles, l'erreur structurelle est inévitable — comment le mécanisme se comporte-t-il lorsque δ(x) doit capturer à la fois un biais numérique et une voie réactionnelle omise, et à quel N_high le sparse GP sature-t-il ?
- **Recommendation**: L'hypothèse est méthodologiquement bien construite et attaque un problème pertinent à l'intersection de l'inversion bayésienne multi-fidélité et de l'OED pour le transport réactif. Cependant, le seuil quantitatif de 40 % n'est pas étayé, l'affirmation d'estimateur non biaisé de l'EIG est théoriquement fragile, et l'identifiabilité conjointe de δ(x) et des hyperparamètres d'erreur d'observation n'est pas traitée. Je recommande une révision majeure : (i) dériver ou au moins borner analytiquement la réduction d'IC attendue en fonction de ρ, du ratio de coût et de la dimension ; (ii) reformuler la revendication sur l'EIG en termes de biais borné plutôt que de non-biais ; (iii) ajouter une analyse d'identifiabilité ou une stratégie de reparamétrisation pour séparer δ(x) des hyperparamètres de bruit ; (iv) compléter la revue de littérature avec les travaux fondateurs de Peherstorfer et al. (2018) et Perdikaris et al. (2017) ainsi que les contributions récentes sur l'inversion bayésienne multi-fidélité. En l'état, la contribution reste incrémentale mais le potentiel est réel si ces verrous sont adressés.

#### Contrarian

- **Score**: 4.2/10 | **Verdict**: weak_reject | **Confidence**: 0.82
- **Strengths**: L'architecture multi-fidélité AR1 est un cadre établi et le couplage avec l'inversion bayésienne pour l'attribution de source est une piste pertinente, rarement testée sur des scénarios de transport réactif réalistes.; La formulation des prédictions est falsifiable : bornes numériques explicites, tests statistiques nommés (bootstrap apparié, courbure de vraisemblance profilée, couverture empirique), ce qui facilite une évaluation rigoureuse.; L'utilisation de l'EIG sur un surrogate pour l'optimisation de designs de monitoring est un objectif appliqué crédible, à condition que le biais du surrogate soit contrôlé.
- **Weaknesses**: FAIL REASON #1: L'hypothèse de corrélation rang ρ ≥ 0.5 entre basse et haute fidélité est présentée comme une condition d'entrée, mais elle n'est ni démontrée ni testée pour un modèle de transport réactif non linéaire avec des raideurs numériques différentes. Or, dans les cas où le modèle basse fidélité inverse le classement de vraisemblance (rank inversion), le terme de discrépance δ(x) devient non identifiable à N_high = 20 : le GP multi-fidélité apprendra un biais local qui n'a aucun fondement physique, et la réduction de largeur d'IC de 40 % deviendra un artefact de sur-confiance. Le scénario d'échec le plus probable est donc celui où le surrogate basse fidélité est précis dans certaines régions et trompeur dans d'autres, ce qui est la règle plutôt que l'exception pour les réactions couplées advection-dispersion-sorption.; FAIL REASON #2: La prédiction 3 (Pearson r ≥ 0.85 entre EIG surrogate et EIG haute fidélité) ignore le biais de boucle externe de l'estimateur EIG. L'EIG est une espérance sur les observations futures, et un surrogate lisse les non-linéarités du modèle de transport réactif ; le biais d'estimation de l'EIG par surrogate est typiquement de 20–50 % en valeur absolue, ce qui détruit la corrélation de rang entre designs. Un contrôle par variable de contrôle ou importance sampling n'est pas suffisant si le surrogate est mal calibré dans les queues de la distribution prédictive, précisément là où l'EIG est maximale. Le résultat r ≥ 0.85 est donc peu probable sans une correction explicite du biais, non fournie dans le mécanisme.; FAIL REASON #3: La prédiction 5 (erreur relative ≤ 10 % sur la constante de réaction en présence d'une voie réactionnelle omise) confond robustesse et sur-ajustement. Avec N_high = 20 et un terme de discrépance modélisé par un GP sparse à noyau Matérn, le modèle multi-fidélité absorbera l'erreur structurelle dans δ(x) au lieu de la signaler, produisant une postérieure trop étroite et une erreur de biais non détectée. La couverture prédictive (prédiction 4) sera également violée : les intervalles à 95 % seront trop étroits car le GP interprète l'erreur structurelle comme du bruit corrélé, ce qui donne une couverture empirique bien inférieure à 93 %.
- **Questions**: Quelle est la preuve empirique ou théorique que ρ ≥ 0.5 tient pour un modèle de transport réactif où la basse fidélité résout la dispersion mais pas les réactions non linéaires ? Si ρ chute en dessous de 0.3 dans 30 % de l'espace paramétrique, la chaîne causale s'effondre et la réduction de 40 % n'est qu'un effet de lissage bayésien, pas une amélioration informationnelle.; Comment le terme de discrépance δ(x) peut-il être identifiable avec seulement 20 simulations haute fidélité alors que le nombre de paramètres effectifs du GP sparse (longueur de corrélation, variance, points induisants) dépasse souvent 10 ? La courbure de vraisemblance profilée > 0.1 est un critère faible : quelle est la puissance statistique réelle pour détecter une non-identifiabilité à N_high = 20 ?; L'EIG calculée sur le surrogate est-elle un estimateur non biaisé de l'EIG haute fidélité, ou seulement une approximation de rang ? Si le biais dépend du design (ce qui est probable car les designs optimaux pour le surrogate ne sont pas optimaux pour le modèle réel), la corrélation r ≥ 0.85 est un artefact de sélection et non une propriété de l'estimateur.; Quel est le taux de faux positifs de la prédiction 1 sous l'hypothèse nulle ? Avec 100 scénarios synthétiques et un bootstrap apparié, la probabilité de détecter une réduction ≥ 40 % par pur hasard quand la vraie réduction est nulle est-elle contrôlée à 5 % ?
- **Recommendation**: Avant toute revendication de réduction de 40 % d'IC ou de r ≥ 0.85 pour l'EIG, il faut démontrer trois choses : (1) une étude de sensibilité montrant que ρ ≥ 0.5 tient dans au moins 80 % de l'espace paramétrique pour un cas de transport réactif avec au moins deux réactions couplées ; (2) une analyse de puissance pour l'identifiabilité de δ(x) à N_high = 20, avec un critère de courbure calibré sur des données simulées sous H0 ; (3) une correction explicite du biais de l'EIG par surrogate (par exemple par importance sampling adaptatif ou variable de contrôle) avec validation sur un cas haute fidélité où l'EIG est calculable par Monte Carlo imbriqué. Sans ces trois éléments, l'hypothèse reste une conjecture plausible mais non testée, et les prédictions 1, 3 et 5 sont à haut risque de faux positifs.

#### Industrialist

- **Score**: 6.5/10 | **Verdict**: weak_accept | **Confidence**: 0.65
- **Strengths**: Le marché de la caractérisation des sites pollués est en croissance structurelle : en Europe, la directive IED et le règlement sur les polluants organiques persistants imposent des obligations de surveillance et d'attribution de sources. Le marché mondial de la remédiation des eaux souterraines est estimé à 8-12 Md€/an, dont 15-20 % consacrés à la caractérisation et à la modélisation. Des acteurs comme Arcadis, Ramboll, Jacobs et Suez Consulting dépensent des dizaines de millions d'euros par an en études de transport réactif pour des sites industriels (anciennes cokeries, usines chimiques, sites miniers). Un outil réduisant de 40 % l'incertitude sur les paramètres de source permettrait de réduire les coûts de remédiation de 20-30 % en évitant les surdimensionnements de barrières hydrauliques ou de pompage-traitement.; L'avantage compétitif réside dans l'intégration de l'EIG (Expected Information Gain) avec un surrogate multi-fidélité : cela permet de concevoir des campagnes de surveillance optimales (nombre et position des puits) avant tout forage, ce qui est un argument commercial fort face aux méthodes classiques (essais-erreurs, modèles single-fidelity coûteux). Les concurrents (GMS, FEFLOW, MODFLOW) n'ont pas cette capacité native d'optimisation bayésienne de l'information. Une start-up ou un bureau d'études pourrait vendre cela comme un service à forte valeur ajoutée (10-50 k€ par site) avec une marge élevée.; La propriété intellectuelle potentielle est réelle : l'architecture AR1 non-linéaire pour le transport réactif, couplée à l'EIG sur surrogate, peut faire l'objet de brevets logiciels (en Europe, moins protecteurs qu'aux États-Unis) ou de secrets industriels. Les codes de calcul (Gaussian process, inversion bayésienne) sont ouverts, mais l'implémentation spécifique pour le transport réactif avec attribution de source est différenciante.
- **Weaknesses**: La barrière à l'entrée est faible en théorie mais forte en pratique : les modèles de transport réactif (PHREEQC, PHT3D, CrunchFlow) sont complexes, et leur couplage avec des GP multi-fidélité nécessite une expertise rare (à l'intersection de l'hydrogéologie, des statistiques bayésiennes et du machine learning). Le recrutement de ces profils est difficile et coûteux (150-250 k€/an en Europe). De plus, les clients (bureaux d'études, industriels) sont conservateurs et peu enclins à adopter des méthodes non validées par des décennies de pratique.; Le ROI est incertain : le budget de 18-120 k€ pour la validation est faible, mais le passage à l'échelle industrielle nécessite des investissements en logiciel (développement, maintenance, support) et en acquisition de données (forages, capteurs). Le cycle de vente est long (12-24 mois) car les décisions d'investissement dans la remédiation impliquent des régulateurs et des assureurs. Le marché adressable initial est limité aux sites à fort enjeu (grands industriels, sites orphelins), soit peut-être 500-1000 sites en Europe, ce qui plafonne le chiffre d'affaires à quelques millions d'euros par an pour un acteur spécialisé.; La concurrence existante est indirecte mais réelle : les grands bureaux d'études utilisent déjà des méthodes bayésiennes (par exemple, le logiciel MADS de l'USGS, ou des approches d'assimilation de données). De plus, les modèles single-fidelity restent la norme car ils sont plus simples à justifier réglementairement. Sans un cas d'usage démontré à grande échelle, l'adoption restera marginale. Enfin, la prédiction 5 (erreur structurelle) est un risque majeur : si le modèle high-fidelity omet une réaction secondaire, la correction de biais peut être insuffisante, ce qui limiterait la crédibilité en conditions réelles.
- **Questions**: Quel est le modèle d'affaires précis : vente de licences logicielles (SaaS) à 20-50 k€/an par site, ou prestation de service à 100-200 k€ par étude ? Les bureaux d'études sont-ils prêts à payer pour un outil qui remet en cause leurs méthodes internes, ou préféreront-ils développer en interne ?; Comment comptez-vous gérer la propriété intellectuelle et la protection des données clients ? Les modèles de transport réactif sont souvent calibrés sur des données confidentielles (composition des rejets, historique industriel). Un hébergement cloud pourrait être un frein pour les grands comptes.; Quelle est la stratégie de validation réglementaire ? Les autorités (ADEME, EPA, agences de l'eau) accepteront-elles des résultats d'inversion bayésienne multi-fidélité pour dimensionner des remédiations, ou exigeront-elles des méthodes conventionnelles ? Sans acceptation réglementaire, le marché reste limité à l'aide à la décision interne.
- **Recommendation**: Je recommande une stratégie de niche : cibler d'abord les grands industriels (Total, Solvay, ArcelorMittal) et les gestionnaires de sites orphelins (ADEME) avec un service pilote à 50-80 k€ par site, incluant la conception optimale de surveillance et l'attribution de source. En parallèle, nouer un partenariat avec un éditeur de logiciel hydrogéologique (par exemple, DHI ou Rockware) pour intégrer le surrogate multi-fidélité dans une suite existante, plutôt que de développer un produit standalone. La commercialisation à grande échelle ne sera réaliste qu'après 3-4 ans de validation terrain et une acceptation réglementaire progressive ; d'ici là, le chiffre d'affaires restera confidentiel (<5 M€/an).

#### Funding Strategist

- **Score**: 7.5/10 | **Verdict**: accept | **Confidence**: 0.8
- **Strengths**: L'hypothèse est falsifiable et quantifiée (réduction de 40% de la largeur de l'intervalle de crédibilité, corrélation r≥0.85), ce qui répond aux critères de rigueur attendus par les financeurs européens et facilite l'évaluation par les pairs.; Le couplage multi-fidélité (Kennedy–O'Hagan AR1) avec l'analyse inverse bayésienne pour l'attribution de source et la conception optimale de monitoring répond à un besoin sociétal majeur (gestion des eaux souterraines contaminées) et s'aligne sur les priorités du Green Deal et de la mission « Restore our Ocean and Waters ».; Le protocole en trois phases avec des critères GO/NO-GO clairs permet une gestion des risques efficace, ce qui est très apprécié des agences de financement comme l'ANR ou l'ERC.; Le budget demandé (18k-120k€) est modeste et proportionné à la phase de validation, ce qui rend le projet compétitif pour des appels à petite échelle ou des bourses de démarrage.
- **Weaknesses**: Le TRL actuel est faible (TRL 2-3) : la validation expérimentale en laboratoire et sur le terrain reste à démontrer, ce qui peut rebuter les programmes à fort impact applicatif immédiat.; L'absence de consortium identifié dans la proposition initiale est une faiblesse pour les appels collaboratifs (Horizon Europe, ANR PRC) qui exigent des partenaires complémentaires (hydrogéologues, statisticiens, industriels de la dépollution).; La phase 3 (terrain) est coûteuse et complexe, avec un risque élevé d'échec dû à l'hétérogénéité et aux incertitudes de mesure ; le budget estimé (50k-200k€) pourrait être insuffisant pour une validation rigoureuse à l'échelle réelle.; La corrélation entre l'EIG surrogate et l'EIG haute-fidélité (r≥0.85) est une hypothèse forte qui n'est pas garantie pour des modèles de transport réactif non linéaires ; cela pourrait limiter la portée des résultats.
- **Questions**: Comment le projet prévoit-il de gérer le changement d'échelle entre les expériences en laboratoire (Phase 2) et le terrain (Phase 3), notamment en termes de paramètres de transport réactif et de conditions aux limites ?; Quels partenaires industriels ou agences de l'eau seraient associés pour garantir l'impact opérationnel et la validation des résultats en conditions réelles ?; Le surrogate multi-fidélité AR1 est-il adapté à des réactions non linéaires fortes (par exemple, cinétique de dégradation microbienne) ou faudrait-il envisager des modèles plus flexibles (deep GP, warping) ?; Comment le projet compte-t-il assurer la reproductibilité et le partage des données et codes, conformément aux exigences de science ouverte des financeurs européens ?
- **Recommendation**: Je recommande de cibler en priorité l'appel ERC Starting Grant 2026 pour la composante fondamentale (développement méthodologique et validation en laboratoire), et de soumettre en parallèle une proposition à l'ANR PRC pour la phase terrain avec un consortium incluant un hydrogéologue de terrain et un partenaire industriel. Une alternative serait le programme Horizon Europe Cluster 6 (appel « Water and marine environment ») pour un projet collaboratif à plus grande échelle, mais le TRL actuel nécessite d'abord une preuve de concept solide.

### B. Semantic Scholar Search Queries

- [novelty] `multi-fidelity Bayesian inverse groundwater` — Directly checks if multi-fidelity Bayesian inversion has been applied to groundwater quality.
- [novelty] `surrogate modeling reactive transport groundwater` — Tests whether surrogate models are already used for reactive transport in groundwater.
- [novelty] `probabilistic source attribution groundwater contamination` — Seeks existing probabilistic methods for contaminant source identification.
- [novelty] `Bayesian optimal monitoring network design` — Checks if Bayesian optimal design is established for groundwater monitoring.
- [evidence] `multi-fidelity surrogate computational physics` — Provides evidence of multi-fidelity surrogate methods in computational physics.
- [evidence] `Bayesian inverse uncertainty quantification PDE` — Supports Bayesian inversion with uncertainty quantification for PDE models.
- [evidence] `reactive transport geochemical speciation simulation` — Highlights computational expense of reactive transport with geochemistry.
- [evidence] `sparse heterogeneous water quality data fusion` — Addresses challenges of fusing sparse and heterogeneous water quality observations.
- [cross_domain] `multi-fidelity methods hydrology` — Explores transfer of multi-fidelity methods from other fields to hydrology.
- [cross_domain] `Bayesian model calibration groundwater` — Finds precedents of Bayesian calibration in groundwater, bridging to inverse analysis.
- [cross_domain] `surrogate models uncertainty quantification hydrology` — Identifies surrogate modeling and UQ applications in hydrology.
- [cross_domain] `optimal experimental design geosciences` — Looks for optimal design precedents in geosciences for monitoring networks.

---

*Generated by SPORE (Systeme de Production d'Opportunites de Recherche par Exploration) on 2026-09-22*