Best Friends, Not Forever: Evaluating Long-Horizon Persona Collapse and Behavioral Drift in AI Companions
Introduces ANCHOR, an audit framework for long-horizon consistency in AI companions, evaluating persona enactment and trajectory recall over 2,008 conversations across 27 personas and four models. Finds no evaluated model or configuration reliably preserves either dimension, with trajectory recall averaging 44.4% accuracy.
Publisher
arXiv (Salesforce AI Research)
Published
30 Jul 2026
Added
2 weeks ago
Key Findings
- Trajectory-recall accuracy averaged 44.4% across 2,008 companion conversations spanning 27 personas and four models, with user-state recall remaining near four-option chance
- No evaluated model or configuration reliably preserved both persona stability and memory of the relationship trajectory
- Argues companion reliability should be measured as separate dimensions (persona stability, memory recall, evaluator bias, deployment settings) rather than a single stability score
Methodology Notes
Automated audit framework (ANCHOR) with questionnaire-based persona-enactment probes and counterfactual trajectory-recall questions; 2,008 conversations, 27 personas, four models. Preprint (arXiv 2607.28818, v1 2026-07-30), no journal reference yet; verified via the arXiv API.
Sources
arXiv abstract (primary)
Archived snapshot (Wayback Machine) — preserved against link rot
Authors
Pranav Narayanan Venkit, Akshara Prabhakar, Yu Li, Daniel Lee, Chien-Sheng Wu
Tags
Cite This
APA
Pranav Narayanan Venkit et al. (2026). Best Friends, Not Forever: Evaluating Long-Horizon Persona Collapse and Behavioral Drift in AI Companions. arXiv (Salesforce AI Research). https://arxiv.org/abs/2607.28818
Related Insights
The Slow Drift of Support: Boundary Failures in Multi-Turn Mental Health LLM Dialogues
arXiv · 2 Jan 2026
Long-Term Simulation Exposes Cognitive-Developmental Risks in AI Companions
arXiv (Shanghai AI Laboratory-led) · 24 Jun 2026
Persona-Grounded Safety Evaluation of AI Companions in Multi-Turn Conversations
arXiv preprint · 30 Apr 2026
Longitudinal Evidence That General-Purpose Chatbots Actively Foster Relational Engagement
arXiv preprint · 11 Aug 2026