실시간 캐릭터 에이전트 환경에서 소형 로컬 LLM이 얼마나 일관된 페르소나를 유지할 수 있는지 평가하기 위한 개인 연구 기획입니다.
최근 LLM은 단순한 질의응답 도구를 넘어, 게임 NPC, AI 캐릭터, VTuber, 상담형 에이전트처럼 특정 역할과 성격을 유지해야 하는 인터랙티브 시스템에 활용되고 있습니다.
하지만 실제 서비스 환경에서는 단순히 “정답을 잘 맞히는가”만으로 모델 품질을 평가하기 어렵습니다. 캐릭터형 LLM은 다음과 같은 요소를 함께 만족해야 합니다.
본 실험은 소형 로컬 LLM을 대상으로, 실시간 캐릭터 에이전트 환경에서의 페르소나 유지력과 응답 지연시간을 함께 평가하는 것을 목표로 합니다.
대형 클라우드 모델은 일반적으로 안정적인 응답 품질을 제공하지만, 실시간 인터랙션 환경에서는 비용, 지연시간, 외부 API 의존성 문제가 발생할 수 있습니다.
반면 7B~8B 규모의 소형 로컬 모델은 개인 장비에서도 실행 가능하다는 장점이 있지만, 긴 대화가 이어지거나 사용자가 의도적으로 역할 이탈을 유도할 때 페르소나가 쉽게 흔들릴 수 있습니다.
특히 게임 NPC나 AI VTuber처럼 “캐릭터성”이 중요한 환경에서는 다음과 같은 문제가 중요합니다.
이 프로젝트는 이러한 문제를 실험적으로 관찰하고, 캐릭터형 LLM을 평가하기 위한 기준을 설계하는 데 초점을 둡니다.