sumitaidev/agent-memory-resilience-benchmark
Agent Memory Resilience & Poisoning Benchmark Dataset Summary This benchmark dataset evaluates resilience, negative transfer, and memory poisoning mitigation in autonomous LLM agent architectures (such as LangGraph, AutoGen, and CrewAI). When autonomous agents record distilled self-reflections after attempting tasks, external stochastic failures or subtle API deprecations often cause agents to commit defective strategies into episodic memory. Under standard… See the full description on the dataset page: https://huggingface.co/datasets/sumitaidev/agent-memory-resilience-benchmark.
Agent Memory Resilience & Poisoning Benchmark
Dataset Summary
This benchmark dataset evaluates resilience, negative transfer, and memory poisoning mitigation in autonomous LLM agent architectures (such as LangGraph, AutoGen, and CrewAI).
When autonomous agents record distilled self-reflections after attempting tasks, external stochastic failures or subtle API deprecations often cause agents to commit defective strategies into episodic memory. Under standard retrieval pipelines using unweighted cosine similarity, flawed memories are repeatedly retrieved due to high prompt keyword similarity, resulting in runaway catastrophic degradation.
This repository provides 1,200 empirical execution traces across four controlled ablation conditions, alongside a verified 100-memory experiential bank containing Bayesian posterior distributions and quarantine status.
Dataset Structure
Configuration: telemetry_traces
File: telemetry_traces.csv (1,200 rows)
Contains chronological execution steps evaluating task completion rates across four experimental conditions under an adversarial noise injection regime (steps 60 to 140).
Configuration: memory_bank_experiences
File: memory_bank_experiences.csv (100 rows)
Structured experiential memory records containing conjugate Beta-Bernoulli update parameters and quarantine tags.
Experimental Conditions
- Vanilla Baseline (Condition A): Zero inter-task episodic memory. Agent approaches every task independently.
- Naive Vector RAG (Condition B): Standard cosine similarity retrieval without reliability tracking. Vulnerable to runaway negative transfer.
- Symmetric Reflexion (Condition C): Exponential Moving Average trust updates ($St = 0.8 S{t-1} + 0.2 r_t$). Lacks statistical confidence bounds.
- Adaptive Bayesian LCB (Condition D - Proposed): Conjugate Beta-Bernoulli updating ($\alpha0=3.0, \beta0=1.0$), epistemic uncertainty quantification, Pessimistic Lower Confidence Bound (LCB) composite retrieval, and Theorem 1 statistical quarantine ($t^* = 4$ consecutive failures for $>95\%$ confidence of degradation).
Usage with Hugging Face Datasets
from datasets import load_dataset
import pandas as pd
# Load telemetry traces
traces_ds = load_dataset("sumitaidev/agent-memory-resilience-benchmark", data_files="telemetry_traces.csv")
df_traces = traces_ds["train"].to_pandas()
print(f"Loaded traces: {df_traces.shape}")
# Load experiential memory bank
memory_ds = load_dataset("sumitaidev/agent-memory-resilience-benchmark", data_files="memory_bank_experiences.csv")
df_memories = memory_ds["train"].to_pandas()
print(f"Loaded memories: {df_memories.shape}")
# Inspect mean reliability across conditions
summary = df_traces.groupby("ablation_condition")["task_success"].mean()
print(summary)Citation
@article{das2026adaptive,
title={Adaptive Agent Memory Resilience: Mitigating Negative Transfer and Memory Poisoning via Bayesian Trust Updating and Pessimistic Lower Confidence Bound Retrieval},
author={Das, Sumit},
journal={arXiv preprint},
year={2026}
}