LongMemEval
AI 비서가 예전 대화를 정말 기억하는지 측정하는 ICLR 2025 벤치마크. 긴 대화 기록 속에 정보를 숨겨두고 나중에 물어보는 500문항으로, 사실 회상·여러 세션 조합·최신 정보 우선·날짜 계산·모르면 모른다고 하기까지 5가지 기억 능력을 채점합니다. 메모리 기능이 있는 AI 도구를 만들거나 고를 때 객관적인 기준이 됩니다.
🔍 에디터 리뷰
cmore가 저장소를 직접 열어보고 써본 뒤 남긴 사용기입니다. 광고·협찬이 아닙니다. 검증일: 2026-07-16 기준의 기록이며, 도구는 계속 바뀝니다.
평가 스크립트(evaluate_qa.py)까지 열어보니 내 시스템을 붙이기가 정말 쉽습니다. 답을 question_id와 hypothesis 두 필드짜리 jsonl로 저장하면 GPT-4o가 유형별 프롬프트로 yes/no 채점을 해줘요. 시간 추론은 하루 오차를 봐주고, 지식 업데이트는 옛 정보를 언급해도 최신 답이 있으면 정답으로 치는 식으로 유형별 관대함이 세심하게 설계돼 있습니다. 세션·턴 단위로 정답 위치가 라벨링돼 있어 '검색이 못 찾았는지, 찾고도 잘못 읽었는지'를 분리 진단할 수 있는 게 이 벤치마크의 진짜 값어치고, 대화 길이를 마음대로 늘리는 합성 파이프라인도 공개돼 있어요.솔직히: 채점이 OpenAI API 호출이라 500문항마다 비용이 들고, 데이터는 2025년 9월에 정제된 cleaned 버전을 받아야 합니다(구버전은 정답 간섭 노이즈가 있어요). 메모리 시스템을 직접 만들거나 검증하는 사람용이지 일반 사용자용 도구는 아닙니다.
설치하기
아직 개발환경(터미널·Git·Node 등)이 없다면 lazy-starter-kit으로 먼저 준비하고 오세요.
설치형 앱이 아니라 평가용 벤치마크입니다. 채점에 OpenAI API 키가 필요하고, 데이터는 반드시 cleaned 버전을 받으세요. 에이전트 맥락용 후속작 LongMemEval-V2도 있습니다.
git clone https://github.com/xiaowu0162/LongMemEval
cd LongMemEval
pip install -r requirements-lite.txt
cd LongMemEval/data
wget https://huggingface.co/datasets/xiaowu0162/longmemeval-cleaned/resolve/main/longmemeval_oracle.json
wget https://huggingface.co/datasets/xiaowu0162/longmemeval-cleaned/resolve/main/longmemeval_s_cleaned.json
xiaowu0162