ConflictScore: Identifying and Measuring How Language Models Handle Conflicting Evidence | ResearchPod