과학기술정보통신부 산하 인공지능안전연구소가 생성형 AI의 위험·오류 사례를 찾는 'AI 안전 지킴이'를 오는 27일까지 모집한다. 국민이 직접 AI 서비스를 사용하다 발견한 문제를 제보하는 방식이다. 전문가 중심의 평가를 넘어, 실제 이용 환경에서 나타나는 사례를 모으기 위한 참여형 모니터링 체계다.
제보 대상은 크게 4개 분야다. 사실 왜곡인 환각, 편향·차별, 보안 취약점, 기술적 결함이 포함된다. 예를 들어 잘못된 사실이나 존재하지 않는 정보를 사실처럼 답하는 경우, 특정 집단에 대한 고정관념이나 불공정한 표현, 프롬프트 인젝션·탈옥을 통한 안전장치 우회 가능성, 개인정보 노출 위험, 반복 응답이나 출력 형식 오류 같은 문제를 제보할 수 있다.
참여자는 사용한 AI 서비스, 입력한 질문이나 명령어, 생성된 전체 답변, 문제가 된 부분을 함께 제출해야 한다. 문제라고 본 이유와 예상 위험도, 재현 방법, 발생 과정, 화면 캡처 등도 요구된다. 이렇게 접수된 사례는 3단계 전문가 검증을 거쳐 정확성, 위험도, 재현 가능성, 활용 가능성을 확인한 뒤 최종 확정된다.
이 사업의 의미는 연구실이나 시험 환경만으로 찾기 어려운 위험을 실제 사용자 경험 속에서 수집한다는 데 있다. 인공지능안전연구소는 이렇게 확보한 사례를 앞으로 AI 위험 평가, 안전 가이드라인 마련, AI 서비스 안전성 개선에 활용할 계획이다.





