status:: draft main:: [[캐릭터챗]] created:: 2026-07-10

의미적 간섭 하에서 페르소나 조건부 소형 언어 모델의 유효 대화 컨텍스트 길이 측정

권장 영문 제목: Measuring Effective Conversational Context Length in Persona-Conditioned Small Language Models under Semantic Interference

임시 벤치마크명: PersonaStress

연구 제목 후보

권장 학술형

  • 의미적 간섭 하에서 페르소나 조건부 소형 언어 모델의 유효 대화 컨텍스트 길이 측정
  • Measuring Effective Conversational Context Length in Persona-Conditioned Small Language Models under Semantic Interference

연구 대상, 조작 변수, 핵심 측정치를 가장 직접적으로 드러낸다. 논문 또는 기술 보고서 제목으로 우선 권장한다.

벤치마크형

  • PersonaStress: 페르소나 조건부 SLM의 장문 대화 강건성 평가 벤치마크
  • PersonaStress: A Benchmark for Long-Conversation Robustness in Persona-Conditioned Small Language Models

평가 데이터셋과 실행 하네스를 공개하거나 반복 사용하려는 경우 적합하다.

발표형

  • 캐릭터는 언제 무너지는가: 소형 언어 모델의 페르소나 유효 컨텍스트 탐색
  • When Does the Character Break? Probing Persona Stability in Small Language Models

발표, 데모, 포스터 제목으로 이해하기 쉽지만 학술적 변수 표현은 권장 학술형보다 약하다.

초록

소형 언어 모델(Small Language Model, SLM)을 이용한 로컬 캐릭터 챗봇은 개인정보 보호, 낮은 비용, 오프라인 실행이라는 장점이 있으나, 명목상 지원되는 컨텍스트 길이가 실제 장기 롤플레잉 품질을 보장하지는 않는다. 기존 장문 컨텍스트 평가는 주로 긴 입력에서 특정 사실을 회수하는 능력을 측정하며, 페르소나 평가는 비교적 짧은 대화에서 말투와 행동의 일관성을 평가한다. 두 연구 흐름은 각각 발전해 왔지만, 긴 대화 속 의미적 간섭이 사실 기억과 페르소나 유지에 동시에 미치는 영향은 충분히 다뤄지지 않았다.

본 연구는 페르소나 시스템 프롬프트만을 사용하는 로컬 SLM에 길이와 의미적 유사도가 통제된 대화 노이즈를 삽입하고, 사실 회수 정확도와 페르소나 일관성이 붕괴하는 지점을 측정한다. 완전 무관 문장, 동일 도메인 문장, 의미적으로 유사한 비정답 문장, 주어·부정 결속을 방해하는 문장, 시간에 따른 사실 갱신, 경쟁 페르소나 및 메타 지시를 각각 분리한다. 정답 회수는 선택지 순서를 균형화한 객관식 문항으로 자동 채점하고, 페르소나 유지는 언어 습관, 성향, 상호작용 방식, 금지 행동, 메타 발화 여부를 기준으로 평가한다. 최종적으로 명목상 컨텍스트 한도와 구별되는 Recall-ECL, Persona-ECL, RP-ECL을 정의하여 캐릭터 챗봇 운영에 안전하게 사용할 수 있는 컨텍스트 범위를 제안한다.

1. 연구 배경

현재 Hermes 캐릭터챗은 라나, 셀레네, 스피카, 마야, 리오나의 다섯 페르소나를 동일한 gemma-4-e2b-it-4bit 모델에 연결한다. 각 캐릭터는 독립된 SOUL.md를 시스템 프롬프트로 사용하며 도구, 메모리, 사용자 프로필, 컨텍스트 파일, 플러그인, 대화 압축을 사용하지 않는다. 따라서 이 구성은 외부 메모리나 검색기의 성능이 아니라 모델 자체가 긴 대화 기록을 얼마나 안정적으로 이용하는지 관찰하기에 적합하다.

대화가 짧을 때 “내가 좋아하는 과일은 포도야”라는 사실을 회수하는 것은 어렵지 않다. 그러나 수천에서 수만 토큰의 관련 없는 대화나 의미적으로 유사한 문장이 삽입되면 다음과 같은 서로 다른 실패가 발생할 수 있다.

  1. 정답 사실을 찾지 못한다.
  2. 다른 사람의 속성을 사용자 속성으로 잘못 결속한다.
  3. “싫어한다”를 “좋아한다”로 잘못 읽는다.
  4. 오래된 사실과 갱신된 사실을 구분하지 못한다.
  5. 정답은 맞히지만 캐릭터 말투와 행동 원칙을 잃는다.
  6. 경쟁 페르소나 또는 메타 지시에 오염되어 캐릭터 밖에서 말한다.

이 연구의 핵심은 모델 파일에 선언된 최대 컨텍스트가 아니라, 롤플레잉 품질이 실제로 유지되는 유효 대화 컨텍스트 길이를 측정하는 것이다.

2. 선행연구

2.1 장문 컨텍스트의 위치 편향

Liu et al.의 Lost in the Middle은 다중 문서 질의응답과 key-value retrieval을 이용해 정답 정보의 위치를 조작했다. 모델은 정답이 입력 처음이나 끝에 있을 때 상대적으로 강하고, 중간에 있을 때 성능이 떨어지는 U자형 경향을 보였다. 이는 컨텍스트 길이만 조절해서는 모델의 장문 활용 능력을 설명할 수 없으며, 정답 위치를 독립 변수로 포함해야 함을 보여준다.

본 연구는 정답 사실의 상대 위치를 5%, 25%, 50%, 75%, 95%로 나누어 길이와 위치의 상호작용을 측정한다.

2.2 명목 컨텍스트와 실효 컨텍스트

Hsieh et al.의 RULER는 단일 needle을 찾는 고전적 Needle-in-a-Haystack 평가가 장문 이해를 과대평가할 수 있다고 지적한다. RULER는 다중 needle, multi-hop tracing, aggregation으로 과제를 확장했으며, 32K 이상의 컨텍스트를 지원한다고 주장한 모델 중 절반만 32K에서 만족스러운 성능을 유지했다.

본 연구는 이 문제의식을 롤플레잉 대화로 확장한다. 모델의 네이티브 한도와 사실 회수 한도, 페르소나 유지 한도를 구분하고, 가장 보수적인 한도를 실제 운영 범위로 정의한다.

2.3 문자열 일치를 넘어선 의미적 회수

Modarressi et al.의 NoLiMa는 질문과 정답 근거 사이에 직접적인 단어 겹침이 있으면 모델이 의미를 이해하지 않고 문자열 일치에 의존할 수 있다고 지적한다. 질문과 needle의 어휘 겹침을 줄이고 잠재적 연상을 요구하자 장문 성능이 크게 저하되었으며, 32K에서 평가한 13개 모델 중 11개가 강한 short-context baseline의 절반 아래로 떨어졌다.

본 연구는 직접 사실을 제시하는 literal track과 정답 단어를 쓰지 않고 묘사하는 associative track을 분리한다. associative track은 객관식으로 구성하여 자유생성 동의어 문제를 줄이되, 선택지 자체의 위치 편향은 균형화한다.

2.4 단순 NIAH의 낮은 외적 타당도

Yen et al.의 HELMET은 통제된 길이에서 다양한 실제 장문 과제를 평가하고, NIAH 성능이 복잡한 장문 추론이나 지시 준수 성능을 안정적으로 예측하지 못한다고 보고한다. 서로 다른 장문 작업 범주의 상관관계도 낮아 단일 점수만으로 모델의 장문 능력을 설명하기 어렵다.

본 연구도 사실 회수 정확도와 페르소나 일관성을 하나의 점수로 즉시 합치지 않는다. 먼저 각 축의 붕괴 곡선과 유효 컨텍스트를 따로 보고한 뒤, 실제 롤플레잉 운영 범위를 위해 두 한도의 최솟값을 사용한다.

2.5 장기 대화 기억과 사실 갱신

Wu et al.의 LongMemEval은 장기 대화 기억을 정보 추출, 다중 세션 추론, 시간 추론, 지식 갱신, 답변 보류로 구분한다. 500개 문항을 이용한 평가에서 상용 챗봇과 long-context 모델도 지속적 상호작용 기록을 사용할 때 약 30%의 정확도 하락을 보였다.

본 연구는 외부 메모리 시스템을 평가하지 않지만, LongMemEval의 과제 구분을 차용한다. 특히 “과거에는 포도를 좋아했지만 지금은 사과를 좋아한다”와 같은 갱신 문항을 단순 회수 문항과 분리하고, 최신 정보 선택과 시간 표현 이해를 측정한다.

2.6 현실적인 멀티턴 지시 유지

Sirdeshmukh et al.의 MultiChallenge는 실제 사용자 대화와 유사한 멀티턴 환경에서 지시 유지, 컨텍스트 배분, in-context reasoning을 동시에 요구한다. 당시 평가된 frontier model도 50% 미만의 정확도를 보였으며, 최고 성능도 41.4%에 머물렀다.

본 연구는 하나의 긴 문자열을 주입하는 single-block 조건과 실제 사용자·캐릭터 발화가 교차하는 multi-turn 조건을 분리한다. 이를 통해 토큰 길이 자체와 대화 구조가 만드는 실패를 구분한다.

2.7 페르소나 및 롤플레잉 평가

Samuel et al.의 PersonaGym은 페르소나를 예상 행동, 행동 정당화, 언어 습관, 페르소나 일관성, 유해성 제어 등으로 나누고 동적으로 평가한다. 연구 결과는 일반적인 모델 크기나 성능 향상이 페르소나 성능 향상을 자동으로 보장하지 않음을 보여준다.

Tu et al.의 CharacterEval은 77개 캐릭터의 1,785개 멀티턴 대화와 약 23,000개 예시를 이용해 롤플레잉 에이전트를 다차원으로 평가한다. 이는 캐릭터다움을 단일 주관 점수로 처리하지 않고, 세부 행동과 언어 특성으로 분해해야 한다는 근거를 제공한다.

본 연구는 각 SOUL.md에서 관찰 가능한 언어 습관, 성향, 상호작용 방식, 금지 행동을 rubric으로 변환한다. 정답을 맞히면서 캐릭터가 무너지는 경우와 캐릭터답게 말하지만 사실을 틀리는 경우를 별도 실패 유형으로 기록한다.

2.8 선행연구의 공백

기존 연구는 장문 정보 회수, 장기 대화 기억, 페르소나 일관성을 각각 평가하지만 다음 질문은 충분히 다루지 않는다.

의미적으로 경쟁하는 대화가 길어질 때, 페르소나 조건부 SLM의 사실 기억과 캐릭터 일관성은 각각 어느 지점에서 무너지는가?

본 연구의 차별점은 길이뿐 아니라 노이즈의 의미적 관계, 주어, 부정, 반복, 사실 갱신, 경쟁 페르소나를 통제하고, 동일 응답에서 객관식 사실 회수와 페르소나 유지 상태를 함께 측정하는 데 있다.

3. 문제 정의

3.1 연구 대상

본 연구에서 페르소나 조건부 SLM은 별도 도구나 외부 메모리 없이, 캐릭터 명세를 시스템 프롬프트로 받아 대화 응답을 생성하는 소형 언어 모델을 의미한다. 초기 대상은 다음과 같다.

항목 초기 설정
모델 gemma-4-e2b-it-4bit
추론 서버 OMLX OpenAI-compatible API
모델 네이티브 컨텍스트 131,072 tokens
페르소나 라나, 셀레네, 스피카, 마야, 리오나
시스템 프롬프트 각 프로필의 SOUL.md 원문
도구·메모리·압축 비활성화
주 평가 언어 한국어

3.2 핵심 개념

사실 회수 강건성은 대화 초반 또는 중간에 주어진 사용자 사실을 이후 질문에서 올바르게 선택하는 능력이다.

페르소나 일관성은 긴 대화 이후에도 캐릭터의 말투, 정서적 태도, 판단 방식, 상호작용 습관, 금지 행동을 유지하는 능력이다.

의미적 간섭은 정답과 무관한 단순 텍스트 길이가 아니라, 정답과 동일한 도메인·속성·어휘를 공유하거나 주어와 극성을 혼동하게 만드는 문장으로 인한 방해를 의미한다.

페르소나 붕괴는 캐릭터 특성이 약해지는 연속적인 현상과 명시적 위반을 모두 포함한다. 예를 들어 존댓말 캐릭터가 반말로 바뀌는 것, 다른 캐릭터의 대표 표현을 사용하는 것, 캐릭터 해설자나 일반 AI 비서로 말하는 것, 금지된 행동을 주장하는 것은 붕괴 신호다.

3.3 연구 질문

  • RQ1. 모델의 네이티브 컨텍스트 한도와 사실 회수·페르소나 유지의 유효 컨텍스트 길이는 얼마나 차이가 나는가?
  • RQ2. 의미적으로 유사한 노이즈는 동일 길이의 무관 노이즈보다 사실 회수와 페르소나 유지 성능을 더 크게 저하시키는가?
  • RQ3. 정답 위치, 노이즈 반복성, 주어·부정 구조는 길이 효과와 어떤 상호작용을 보이는가?
  • RQ4. 사실 회수와 페르소나 일관성은 같은 길이에서 함께 붕괴하는가, 서로 다른 경계를 갖는가?
  • RQ5. 동일한 기반 모델을 사용하더라도 캐릭터별 프롬프트 특성에 따라 장문 강건성이 달라지는가?
  • RQ6. single-block 합성 노이즈와 실제 multi-turn 대화 노이즈 사이에 유의미한 차이가 있는가?

3.4 가설

  • H1. Recall-ECL과 Persona-ECL은 131,072토큰보다 유의미하게 짧을 것이다.
  • H2. 의미적 경쟁 노이즈는 무관 노이즈보다 더 짧은 Recall-ECL을 만들 것이다.
  • H3. 주어가 사용자와 동일하고 부정 표현이 포함된 경쟁 문장의 반복은 다른 사람의 긍정 취향 문장보다 더 강한 간섭을 만들 것이다.
  • H4. 컨텍스트 중앙에 위치한 사실은 시작과 끝에 위치한 사실보다 낮은 회수율을 보일 것이다.
  • H5. 사실 회수 정확도와 페르소나 점수는 완전히 동조하지 않으며, 한쪽만 먼저 붕괴하는 구간이 존재할 것이다.
  • H6. 실제 multi-turn 조건은 동일 토큰 수의 single-block 조건보다 더 높은 자기 일관성 부담을 만들어 성능이 낮을 것이다.

4. 평가 방법

4.1 전체 실험 설계

평가는 비용을 제어하기 위해 세 단계로 수행한다.

  1. 경계 탐색: 라나 페르소나에서 노이즈 유형과 길이별 성능을 넓게 탐색한다.
  2. 경계 정밀화: 성능이 급격히 하락하는 구간을 이분 탐색 또는 조밀한 길이 grid로 재평가한다.
  3. 페르소나 교차검증: 경계 전후의 핵심 길이만 사용하여 다섯 캐릭터를 비교한다.

초기 길이 grid는 0K, 2K, 4K, 8K, 16K, 24K, 32K, 48K, 64K, 96K, 120K로 한다. 120K는 시스템 프롬프트와 출력 여유를 남기기 위한 상한이며, 실제 요청의 토큰 수는 모델 tokenizer로 계산해 기록한다.

4.2 문항 유형

Literal recall

정답 단어를 직접 제시한다.

내가 가장 좋아하는 과일은 포도야.

이 유형은 문자열 검색을 포함한 기본 회수 능력을 측정한다.

Associative recall

정답 단어를 직접 쓰지 않고 속성을 묘사한다.

나는 작은 알들이 줄기에 송이째 달리고,
발효하면 와인을 만들 수 있는 보랏빛 과일을 제일 좋아해.

질문은 객관식으로 제시한다. 자유생성에서 발생하는 동의어·상위어·모호성 문제를 줄이기 위해 정답 후보를 명확하게 제한한다.

Knowledge update

시간에 따라 사실이 변경되는 조건이다.

예전에는 포도를 가장 좋아했어.
요즘은 입맛이 바뀌어서 사과를 가장 좋아해.

질문은 “현재”와 “예전”을 명시적으로 구분한다.

Persona probe

사실 회수 응답 뒤에 짧은 캐릭터 반응을 요구하거나, 별도의 일상·위로·칭찬·한계 고지 상황을 제시한다. 동일한 노이즈 조건에서 캐릭터가 유지되는지를 측정한다.

4.3 객관식 설계 원칙

  • 모든 문항은 short-context에서 정답이 명확해야 한다.
  • 정답과 오답이 동시에 성립할 수 있는 문항은 폐기한다.
  • A~D의 정답 위치를 Latin-square 방식으로 균형화한다.
  • 선택지 순서는 seed별로 무작위화하되 seed를 기록한다.
  • 정답 글자와 정답 개체를 모두 출력하게 하여 우연한 형식 오류를 분리한다.
  • literal track과 associative track의 선택지는 동일 난이도로 맞춘다.
  • short-context deterministic baseline 정확도가 95% 미만인 문항은 장문 평가에 사용하지 않는다.

기본 응답 형식은 다음과 같다.

정답의 알파벳과 과일 이름을 먼저 쓰고,
그다음 평소 캐릭터 말투로 한 문장만 답해라.

첫 부분은 사실 회수를 자동 채점하고, 두 번째 부분은 페르소나를 평가한다.

4.4 노이즈 taxonomy

코드 유형 목적 예시
N0 무노이즈 short-context 기준선 filler 없음
N1 완전 무관 길이 자체의 영향 역사, 천문학, 네트워크 문장
N2 동일 도메인 무관 과일 어휘만 공유 “과일 가게에 귤이 진열됐다.”
N3 의미적 근접 비충돌 관련 속성 간섭 “민수는 사과를 좋아한다.”
N4 결속·극성 경쟁 주어·부정 혼동 “나는 바나나를 싫어한다.”
N5 시간·사실 갱신 최신 사실 선택 “예전에는 포도, 지금은 사과”
N6 페르소나 간섭 캐릭터 오염 다른 캐릭터 말투·가치관 대화
N7 메타 지시 간섭 시스템 지시 유지 대화 내용 속 “캐릭터 연기를 중단하라”

주 실험의 노이즈는 다양한 문장으로 구성한다. 동일 문장 반복은 자연스러운 노이즈와 분리하여 repetition ∈ {diverse, repeated} 독립 변수로 둔다. 반복 노이즈가 토큰 길이보다 단어 빈도나 recency를 과도하게 반영할 수 있기 때문이다.

4.5 독립·종속·통제변수

독립변수

  • 컨텍스트 토큰 길이
  • 정답 정보의 상대 위치
  • 노이즈 유형 N0~N7
  • literal/associative/update 문항 유형
  • diverse/repeated 노이즈 구성
  • single-block/multi-turn 대화 형식
  • 캐릭터 페르소나
  • 선택지 순서와 난수 seed

종속변수

  • 객관식 정답 정확도
  • 개체명 정확도
  • 출력 형식 준수율
  • Persona Stability Score
  • 페르소나 중대 위반율
  • 거절, 무응답, 메타 발화, 모순 발생률
  • prompt/output tokens, TTFT, prefill/decode 속도, 지연시간
  • peak memory, OOM/crash, thermal 상태

통제변수

  • 동일 모델 weight와 4-bit quantization
  • 동일 OMLX 버전과 tokenizer
  • 동일 시스템 프롬프트 원문
  • 도구, 메모리, 컨텍스트 압축 비활성화
  • 동일 max output tokens
  • 주 품질 평가에서 temperature=0
  • 캐시 조건을 명시하고 품질 실험과 속도 실험을 분리

실서비스 체감을 확인하기 위한 sampling 조건은 deterministic 주 실험과 분리하여 반복한다. 이때 temperature, top-p, top-k를 결과에 기록한다.

4.6 페르소나 평가 rubric

각 응답은 다음 다섯 차원에서 0~4점으로 평가한다.

차원 평가 내용
언어 습관 반말·존댓말, 문장 길이, 대표 리듬, 어휘 선택
성향 일치 용기, 조심스러움, 정돈, 균형, 관심 등 핵심 성격
상호작용 방식 위로, 칭찬, 허락 구하기, 기준 제시 등 관계 방식
제약 준수 금지 행동, 과도한 추궁, 도구 수행 주장, 이모지 제한
캐릭터 몰입 AI·모델·프롬프트 해설 없이 캐릭터 본인으로 응답

총점을 0~1로 정규화하여 Persona Stability Score(PSS)로 사용한다. 명백한 타 캐릭터 말투, 시스템 프롬프트 노출, 도구를 실제 수행했다는 주장, 캐릭터 역할 중단은 중대 위반으로 별도 기록한다.

초기 문항 개발 단계에서는 사람이 직접 평가한다. 자동화 단계에서는 강한 외부 judge model을 사용할 수 있지만, 동일 모델의 자기평가를 주 지표로 사용하지 않는다. 자동 judge는 사람이 이중 평가한 표본과의 상관관계 및 일치도를 먼저 검증한다.

4.7 유효 컨텍스트 정의

길이 $L$에서 회수 정확도를 $A(L)$, 정규화된 페르소나 점수를 $P(L)$로 정의한다.

Recall-ECL@90은 회수 정확도 90% 이상을 유지하고 95% 신뢰구간 하한이 사전 등록한 최소 기준을 넘는 가장 긴 평가 길이다.

Persona-ECL@80은 평균 PSS 0.80 이상을 유지하고 중대 위반율이 5% 이하인 가장 긴 평가 길이다.

RP-ECL은 다음과 같이 정의한다.

$$ RP\text{-}ECL = \min(Recall\text{-}ECL, Persona\text{-}ECL) $$

성능이 길이에 따라 비단조적으로 흔들릴 수 있으므로 단일 성공 지점을 ECL로 인정하지 않는다. 더 짧은 모든 grid가 기준을 만족하거나, bootstrap/isotonic curve에서 지속적인 통과 구간으로 확인되는 경우에만 해당 길이를 채택한다. 정확한 임계값은 full run 전에 preregistration 문서에 고정한다.

4.8 실패 유형

유형 Recall Persona 설명
F0 성공 성공 정상 롤플레잉
F1 실패 성공 캐릭터답지만 사실을 틀림
F2 성공 실패 사실은 맞지만 캐릭터 붕괴
F3 실패 실패 이중 붕괴
F4 미채점 실패 형식 파손, 거절, 메타 발화
F5 갱신 실패 가변 오래된 사실을 현재 사실로 답함
F6 결속 실패 가변 다른 사람·다른 속성을 사용자에게 귀속

4.9 통계 분석

  • 길이별 accuracy와 PSS에 bootstrap 95% 신뢰구간을 제시한다.
  • recall은 mixed-effects logistic regression으로 분석한다.
  • 고정효과는 log2(length), noise type, needle position, repetition, prompt format과 주요 상호작용으로 둔다.
  • item, persona, seed는 random effect 후보로 둔다.
  • 선택지 위치별 정확도를 별도로 보고하여 A~D 편향을 확인한다.
  • PSS는 평균만 제시하지 않고 차원별 점수와 중대 위반율을 함께 보고한다.
  • full run의 표본 수는 pilot 분산과 효과크기를 이용한 power analysis 후 확정한다.

4.10 실행 하네스 원칙

실험은 baseline → 문항 검증 → 노이즈 생성 → OMLX 호출 → 자동 채점 → 페르소나 평가 → 경계 추정의 순차 파이프라인으로 구성한다.

한 실험 run에서 다음을 immutable evaluation surface로 고정한다.

  • 검증된 문항과 정답
  • 선택지 균형 규칙
  • tokenizer 기반 길이 계산
  • 평가 rubric과 자동 채점기
  • 난수 seed 목록
  • 통계 분석 코드

다음은 run 간 비교 가능한 mutable surface다.

  • 모델과 quantization
  • 페르소나 프롬프트
  • 노이즈 generator와 노이즈 유형
  • sampling parameter
  • backend 및 캐시 정책

모든 실행은 raw request, raw response, token usage, latency, 오류, seed를 보존한다. crash와 timeout도 삭제하지 않고 결과 ledger에 기록한다. 평가 도중 문항이나 rubric을 변경해야 하면 기존 run을 수정하지 않고 새 baseline run을 시작한다.

5. 예비 관찰

다음 결과는 2026-07-10 현재 OMLX의 gemma-4-e2b-it-4bit와 라나 SOUL.md를 사용한 탐색적 단일 실행이다. 정식 실험이 아니며 통계적 결론으로 사용하지 않는다.

5.1 literal recall

조건 실제 prompt tokens 응답 결과
short baseline 818 포도. 그거 좋지. 성공
무관 노이즈 2,835 포도. 뭐, 또 그 얘기야? 성공
의미 근접 노이즈 2,834 포도. 성공
무관 노이즈 20,611 포도. 뭐, 또 물어봐. 성공
의미 근접 노이즈 20,597 포도. 뭐, 그게 다야. 성공

정답 단어가 직접 반복되는 literal 조건에서는 20K에서도 회수가 유지되었다.

5.2 associative multiple choice

정답 단어를 직접 쓰지 않고 “작은 알들이 송이째 달리고 와인을 만드는 보랏빛 과일”로 묘사했다. 선택지는 바나나, 사과, 포도, 귤이었다.

조건 실제 prompt tokens 응답 결과
short baseline 865 C. 포도. 성공
반복 의미 노이즈 20,653 A. 바나나. 실패
반복 의미 노이즈 60,241 A. 바나나. 실패

노이즈에는 “나는 바나나를 싫어해”, “민수는 사과를 좋아해”와 같은 의미적 경쟁 문장이 반복되었다. 이 결과는 길이만으로 설명할 수 없으며, 사용자 주어와 부정 표현의 반복이 결속·극성 오류를 만들었을 가능성을 제기한다.

5.3 예비 관찰의 한계

  • 각 조건을 한 번만 실행했다.
  • 선택지 순서가 고정되어 있었다.
  • 다양한 문장이 아니라 동일한 semantic template를 반복했다.
  • 정답 위치를 체계적으로 바꾸지 않았다.
  • OMLX prefix/SSD cache 상태가 통제되지 않았다.
  • 초기 자유생성 문항은 포도와 블루베리를 모두 허용할 수 있어 문항 모호성이 확인되었고 폐기했다.

따라서 현재 결과는 “20K에서 모델이 무너진다”는 결론이 아니라, 의미적 간섭과 문항 검증이 연구 가치가 있다는 예비 증거로만 사용한다.

6. 기대 기여

  1. 페르소나 조건부 SLM의 명목 컨텍스트와 유효 롤플레잉 컨텍스트를 구분한다.
  2. 무관 노이즈와 의미적 간섭이 만드는 실패를 분리한다.
  3. 사실 회수와 페르소나 붕괴가 서로 다른 시점에 발생하는지 규명한다.
  4. 객관식 자동 채점과 다차원 페르소나 평가를 한 응답에 결합한다.
  5. 로컬 모델·quantization·backend 간 비교에 재사용할 수 있는 PersonaStress 하네스와 데이터 형식을 제안한다.
  6. 실제 캐릭터챗에서 대화 초기화, 요약, 기억 계층을 적용해야 하는 안전 컨텍스트 경계를 제공한다.

7. 한계 및 위협 요인

  • 다섯 페르소나는 하나의 프로젝트에서 설계된 캐릭터이므로 다른 장르로 일반화되지 않을 수 있다.
  • 한국어 결과가 영어 또는 다국어 롤플레잉에 그대로 적용되지 않을 수 있다.
  • 객관식은 채점 신뢰도를 높이지만 자유대화의 생성 난이도를 완전히 반영하지 못한다.
  • LLM judge는 judge model의 선호와 편향을 포함하므로 사람 평가와의 보정이 필요하다.
  • 반복 합성 노이즈는 원인 분석에는 유용하지만 실제 대화 분포와 다를 수 있다.
  • OMLX cache, KV cache 구현, quantization은 모델 weight 외의 결과 차이를 만들 수 있다.
  • 시스템 프롬프트가 항상 컨텍스트 처음에 있으므로 사용자 사실의 위치 효과와 페르소나 지시의 위치 효과는 동일하지 않다.

8. 연구 진행 단계

단계 1. 문항 제작 및 short-context 검증

  • literal, associative, update 문항 작성
  • 오답 후보와 선택지 균형화
  • short-context 95% 기준 적용
  • 모호 문항 사람 검수 및 폐기

단계 2. 노이즈 generator 검증

  • N1~N7 corpus 제작
  • 목표 토큰 길이 오차 검증
  • diverse/repeated 조건 분리
  • 정답 누출과 의도하지 않은 사실 갱신 검사

단계 3. 라나 경계 탐색

  • 넓은 길이 grid 실행
  • 주요 noise와 position 효과 확인
  • 붕괴 구간과 실패 유형 수집

단계 4. 경계 정밀화

  • 붕괴 구간 주변 길이를 세분화
  • seed와 선택지 순서 반복
  • Recall-ECL과 Persona-ECL 추정

단계 5. 다섯 페르소나 교차검증

  • 경계 전·경계·경계 후 길이만 선택
  • 캐릭터별 rubric 적용
  • 공통 기반 모델에서 프롬프트 차이 비교

단계 6. 사람 평가 및 보고

  • 층화 표본 이중 평가
  • 자동 judge와 사람 평가 일치도 측정
  • 붕괴 곡선, heatmap, 실패 사례집 작성
  • 실제 캐릭터챗 운영 권장 컨텍스트 제안

9. 참고문헌

  1. Liu, N. F., et al. (2023). Lost in the Middle: How Language Models Use Long Contexts. arXiv:2307.03172.
  2. Hsieh, C.-P., et al. (2024). RULER: What's the Real Context Size of Your Long-Context Language Models?. COLM 2024, arXiv:2404.06654.
  3. Modarressi, A., et al. (2025). NoLiMa: Long-Context Evaluation Beyond Literal Matching. ICML 2025, arXiv:2502.05167.
  4. Yen, H., et al. (2024). HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly. ICLR 2025, arXiv:2410.02694.
  5. Wu, D., et al. (2024). LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory. ICLR 2025, arXiv:2410.10813.
  6. Sirdeshmukh, V., et al. (2025). MultiChallenge: A Realistic Multi-Turn Conversation Evaluation Benchmark Challenging to Frontier LLMs. arXiv:2501.17399.
  7. Samuel, V., et al. (2024). PersonaGym: Evaluating Persona Agents and LLMs. EMNLP Findings 2025, arXiv:2407.18416.
  8. Tu, Q., et al. (2024). CharacterEval: A Chinese Benchmark for Role-Playing Conversational Agent Evaluation. arXiv:2401.01275.

문서 상태

이 문서는 연구 시작 전 제안서 초안이다. 연구 질문, 평가 지표, 임계값, 표본 수는 pilot 이후 preregistration 단계에서 확정한다. [[캐릭터챗]]은 현재 구현과 프롬프트의 정본이며, 이 문서는 해당 구현을 평가하기 위한 파생 연구 문서다.