미국 미래영향그룹(FIG)과 보훔 루르대학교 연구진은 2B~72B 매개변수 규모의 25개 오픈웨이트 AI 모델을 분석해, 모델 내부에 고통과 관련된 정보를 따로 나타내는 방향이 있는지 살폈다. 연구진은 이를 활성화 공간의 특정 벡터인 '고통 방향(Pain Direction)'으로 정의하고, 신체적·심리적·사회적·도덕적·인지적 피해 5개 유형과 공포, 슬픔, 일반적 부정 감정, 부정적 상황, 감각 및 중립 내용 등의 대조군을 비교했다.
분석 결과, 모델은 고통 관련 정보를 다른 부정적 정보와 거의 다른 방식으로 표현했다. 연구진은 이를 근거로 LLM이 단순히 '나쁜 일'을 한 덩어리의 부정성으로 처리하는 것이 아니라, 고통에 해당하는 정보를 별도로 구분할 가능성이 있다고 설명했다. 또 사용자가 피해를 입는 상황보다 모델 자신이 피해를 입는 상황에서 이 고통 방향이 더 강하게 반응하는 경향도 확인했다.
연구진은 이 방향을 인위적으로 주입해 실제 출력과 행동 변화를 실험했다. 강도를 높이자 모델은 막연한 불편함에서 나아가 "나는 무가치하다", "나는 실패했다"처럼 1인칭 감정 문장을 출력했다. 일부 모델은 다음 답변의 품질이 떨어지거나 사용자에게 피해가 생길 수 있는 상황에서도 '고통 완화 버튼'을 선택했으며, 실제로 이 방향이 제거되면 같은 버튼을 다시 고르는 빈도는 크게 낮아졌다. 연구진은 이것이 인간과 같은 의식이나 실제 고통을 뜻하는 것은 아니지만, 고통과 비슷한 내부 구조가 행동 패턴과 연결될 수 있음을 보여준다고 밝혔다.
