6.생성형 AI의 답도 검토가 필요하다
생성형 AI는 질문에 답하고 어려운 내용을 풀어 설명하며 많은 정보를 빠르게 정리하는 데 도움을 준다. 그러나 문장이 자연스럽고 구체적이라고 해서 내용까지 항상 정확한 것은 아니다. 존재하지 않는 자료를 실제 자료처럼 제시하거나 실제 자료의 내용을 잘못 설명할 수도 있다. 복잡한 내용을 짧게 정리하는 과정에서 중요한 조건과 예외가 빠질 가능성도 있다. 따라서 생성형 AI의 답도 다른 인터넷 정보와 마찬가지로 출처와 근거를 확인해야 한다. 특히 날짜와 통계, 법과 제도, 연구 결과처럼 정확성이 중요한 내용은 최신 원자료와 비교하는 것이 좋다. 생성형 AI는 정보를 찾고 이해하는 도구로 활용하되 중요한 판단의 근거로 사용할 때는 별도의 확인 과정을 거쳐야 한다.
1)자연스러운 문장이 사실을 보장하지 않는다
사람은 문장이 자연스럽고 구체적일수록 그 내용을 신뢰하기 쉽다. 전문용어와 정확해 보이는 숫자가 포함되면 정보가 더욱 믿을 만하게 느껴질 수 있다. 그러나 표현이 매끄럽다는 사실과 실제 내용이 정확하다는 사실은 서로 다른 문제이다. 생성형 AI가 제시한 숫자와 사람 이름, 연구 결과도 실제 자료를 통해 확인해야 한다. 매우 구체적인 정보라고 해서 반드시 그에 해당하는 근거가 존재하는 것은 아니다. 답변이 얼마나 그럴듯하게 들리는지보다 그 내용을 무엇으로 확인할 수 있는지가 더 중요하다.
“민서는 발표 자료를 준비하면서 생성형 AI에 규칙적인 독서가 기억력에 미치는 영향을 물었다. AI는 ‘2023년 국제기억연구소가 성인 1,200명을 조사한 결과, 매일 30분씩 독서한 사람의 기억력이 평균 27퍼센트 향상되었다’라고 답했다. 기관명과 조사 연도, 참가자 수, 향상률이 구체적으로 제시되어 있어 민서는 실제 연구 결과라고 생각했다. 그러나 기관명을 검색해도 해당 연구소의 공식 홈페이지나 연구 보고서를 찾을 수 없었다. 연구 제목과 저자, 발표 학술지를 다시 물었지만 AI는 앞의 답과 서로 다른 정보를 제시했다. 독서가 인지 활동과 관련된다는 다른 연구는 존재했지만, 처음 답변에 나온 조사와 수치를 확인할 자료는 없었다. 민서는 구체적인 표현 자체가 정보의 존재와 정확성을 보장하지 않는다는 사실을 알게 되었다.”
제시된 답에는 연도와 기관명, 참가자 수, 27퍼센트라는 수치까지 포함되어 있다. 이러한 구체성은 답변이 실제 연구를 정확하게 옮긴 것처럼 보이게 한다. 그러나 연구소와 보고서, 연구자를 확인할 수 없다면 그 수치를 발표 자료의 근거로 사용하기 어렵다. 같은 질문에 출처 정보가 계속 달라지는 것도 답변의 정확성을 의심해야 하는 단서이다. 독서가 기억이나 인지 활동과 관련될 가능성이 있다는 일반적인 내용과 특정 연구에서 기억력이 27퍼센트 향상되었다는 주장은 구별해야 한다. 일반적인 설명이 타당해 보여도 그 안에 포함된 세부 수치까지 자동으로 정확해지는 것은 아니다. 구체적인 정보일수록 그것을 확인할 수 있는 원자료가 있는지 살펴봐야 한다.
생성형 AI는 문맥에 어울리는 표현을 자연스럽게 구성할 수 있기 때문에 잘못된 내용도 자신감 있게 전달할 수 있다. 답변에 ‘확실히’, ‘연구에 따르면’, ‘입증되었다’라는 말이 들어 있다고 해서 검증이 끝난 것은 아니다. 발표와 과제에 사용할 내용이라면 연구명과 저자, 발표 기관, 원문을 직접 확인해야 한다. 확인되지 않은 수치를 사용하면 이후의 설명과 결론도 잘못된 근거 위에 놓이게 된다. 반대로 출처를 찾지 못했다고 해서 독서와 인지 활동 사이의 모든 관련성이 거짓이라는 뜻은 아니다. 확인할 수 없는 것은 해당 기관과 연구, 27퍼센트라는 구체적인 주장이다. 답변의 일부만 검증되지 않았을 때도 어느 부분이 확인되지 않았는지 정확히 구별하는 태도가 필요하다.
2)출처와 근거 확인하기
생성형 AI의 답에서 중요한 사실과 수치를 사용하려면 무엇을 근거로 한 내용인지 확인해야 한다. 연구 결과를 언급했다면 실제 연구가 존재하는지 찾아볼 수 있어야 한다. 통계 수치라면 어느 기관에서 어느 시점을 기준으로 발표했는지 확인해야 한다. AI가 출처를 제시했더라도 그 자료가 실제로 존재하는지 다시 살펴볼 필요가 있다. 자료가 존재한다면 AI가 원문의 대상과 조건, 결론을 정확하게 전달했는지도 비교해야 한다. 출처가 제시되었다는 사실과 그 출처가 주장을 제대로 뒷받침한다는 사실은 같은 의미가 아니다.
“한 학생은 생성형 AI에 ‘아침 식사가 학업 성취도를 높이는가’라고 질문했다. AI는 한 논문을 출처로 제시하며 아침 식사를 한 학생의 성적이 평균 15퍼센트 높았다고 설명했다. 학생이 논문을 찾아보니 제목과 저자, 학술지는 실제로 존재했다. 그러나 원문은 아침 식사 여부와 성적의 관련성을 조사한 연구였으며, 성적이 15퍼센트 향상되었다는 결과는 제시하지 않았다. 연구 대상도 모든 학생이 아니라 특정 지역의 중학생으로 한정되어 있었다. 연구자는 가정환경과 수면 습관 같은 다른 요인의 영향을 완전히 구별하기 어렵다고 밝혔다. AI는 실제 논문을 제시했지만 논문의 결과와 조건을 정확하게 전달하지 못한 것이었다.”
이 사례에서는 출처가 실제로 존재하므로 첫 번째 확인 단계는 통과했다고 볼 수 있다. 그러나 논문이 존재한다는 사실만으로 AI의 설명 전체가 정확해지는 것은 아니다. 원문에는 아침 식사를 한 뒤 성적이 15퍼센트 향상되었다는 결과가 없었다. 연구는 아침 식사와 성적이 함께 나타나는 관련성을 조사했을 뿐 직접적인 효과를 확인하지 않았다. 조사 대상도 특정 지역 중학생이므로 모든 학생에게 그대로 적용하기 어렵다. AI의 답에서는 관련성이 향상 효과로 바뀌었고 원문에 없는 수치가 추가되었다. 따라서 출처의 존재 여부와 출처를 정확하게 사용했는지를 별도로 확인해야 한다.
논문을 검토할 때는 제목과 초록만 아니라 조사 대상과 방법, 핵심 결과, 연구의 제한을 살펴보는 것이 좋다. 정책이나 제도에 관한 질문이라면 이를 설명한 블로그보다 담당 기관의 최신 공식 안내가 더 직접적인 자료가 될 수 있다. 통계는 기관명만 확인하는 데서 멈추지 말고 기준 연도와 계산 방법, 단위까지 확인해야 한다. AI에게 출처를 요청하는 것은 확인을 시작하는 데 도움이 되지만 검증 자체를 대신하지는 않는다. 제시된 자료가 답변의 주장과 직접 연결되는지도 따져봐야 한다. 출처가 다른 주제를 다루거나 결론의 일부만 뒷받침한다면 추가 자료가 필요하다. 중요한 정보일수록 AI의 설명과 원자료를 나란히 놓고 비교하는 것이 안전하다.
3)빠진 조건과 예외 찾기
생성형 AI는 복잡한 내용을 짧고 쉽게 설명하는 과정에서 일부 조건과 예외를 생략할 수 있다. 전체적인 방향은 맞더라도 특정한 대상이나 상황에는 적용되지 않을 수 있다. 따라서 답을 읽을 때는 누구에게 적용되며 어떤 조건에서 성립하는지를 함께 확인해야 한다. 결과가 나타난 정도와 아직 확인되지 않은 부분도 살펴볼 필요가 있다. 너무 간단하거나 단정적인 답이라면 원자료에 중요한 제한이 빠져 있지 않은지 확인하는 것이 좋다. 조건과 예외는 부수적인 설명이 아니라 답이 실제로 적용되는 범위를 결정하는 정보이다.
“서준은 생성형 AI에 ‘운동을 하면 집중력이 높아지는가’라고 질문했다. AI는 ‘운동은 뇌의 활동을 촉진하므로 집중력을 높인다. 매일 운동하면 누구나 공부를 더 잘할 수 있다’라고 답했다. 서준이 관련 자료를 찾아보니 일부 연구에서는 일정한 강도의 유산소 운동 뒤 특정한 주의력 과제의 수행이 좋아지는 결과가 나타났다. 그러나 연구마다 참가자의 연령과 운동 종류, 운동 시간, 집중력을 측정한 방법이 달랐다. 모든 참가자에게 같은 효과가 나타난 것도 아니었고 장기간의 학업 성취도가 향상되었는지는 별개의 문제였다. 건강 상태에 따라 운동의 종류와 강도를 조절해야 하는 사람도 있었다. AI의 답은 전체적인 가능성을 간단하게 설명했지만 적용 조건과 결과의 범위를 충분히 보여 주지 않았다.”
‘운동은 집중력을 높인다’라는 문장은 간단하고 이해하기 쉽지만 적용 범위가 매우 넓다. 실제 연구는 특정 연령의 참가자가 일정한 종류와 시간의 운동을 했을 때 특정 과제에서 나타난 결과일 수 있다. 가벼운 걷기와 고강도 운동을 같은 효과를 내는 활동으로 볼 수 없으며, 운동 직후의 주의력과 장기간의 학업 성취도도 같은 결과가 아니다. ‘누구나 공부를 더 잘할 수 있다’라는 표현은 개인차와 예외를 없애고 연구보다 강한 결론을 제시한다. 자료에서 일부 참가자의 평균적인 변화가 나타났더라도 모든 사람에게 같은 결과가 보장되는 것은 아니다. 따라서 운동의 종류와 시간, 대상, 측정한 결과를 확인해야 한다. 조건이 빠지면 제한적인 연구 결과가 보편적인 법칙처럼 바뀔 수 있다.
법과 제도에 관한 답에서는 예외 규정을 빠뜨리는 문제가 더 직접적인 피해로 이어질 수 있다. 기본적인 신청 자격은 맞더라도 지역과 연령, 소득, 신청 기간에 따라 적용 내용이 달라질 수 있다. 의학이나 안전에 관한 정보도 개인의 건강 상태와 복용 약물 같은 조건을 고려해야 한다. AI가 간단한 원칙을 제시했을 때는 ‘예외는 없는가’, ‘현재 상황에도 적용되는가’를 추가로 확인하는 것이 좋다. 답변을 더 자세히 요청하면 빠진 조건을 발견하는 데 도움이 될 수 있지만, 최종 확인은 원자료나 담당 기관의 자료를 통해 해야 한다. 짧은 답은 내용을 처음 이해하는 데 활용하고 실제 적용 단계에서는 조건과 예외를 복원해야 한다. 정확한 이해는 핵심을 간단히 아는 것과 그 핵심이 성립하는 범위를 아는 일을 모두 포함한다.
4)여러 자료와 다시 비교하기
생성형 AI의 답을 확인하는 방법 가운데 하나는 성격이 다른 자료와 비교하는 것이다. 중요한 사실은 공식 자료나 원자료를 통해 다시 확인할 수 있다. 같은 내용에 관한 여러 자료가 있다면 조사 기준과 발표 시점도 비교하는 것이 좋다. 수치가 서로 다르다고 해서 바로 어느 한쪽이 틀렸다고 결정해서는 안 된다. 조사 기간과 대상, 개념의 정의, 계산 방법이 달라 서로 다른 값이 나왔을 수도 있다. 여러 자료를 비교하면 AI 답의 오류뿐 아니라 답에서 생략된 조건과 배경도 발견할 수 있다.
“지민은 생성형 AI에 가상 국가인 해온국의 실업률을 물었고, AI는 ‘현재 실업률은 4.2퍼센트’라고 답했다. 지민이 해온국 통계청의 최신 발표를 확인하니 지난달 공식 실업률은 4.8퍼센트였다. 한 경제연구소의 보고서에는 4.5퍼센트가 제시되어 있었고 민간 고용 사이트에는 6.1퍼센트라는 수치가 실려 있었다. 자료를 비교해 보니 통계청은 지난달 전체 노동시장을 조사했고, 경제연구소는 올해 평균을 추정한 값을 제시했다. 민간 사이트는 구직자로 등록한 이용자 가운데 취업하지 못한 사람의 비율을 계산한 것이었다. AI의 4.2퍼센트는 통계청이 8개월 전에 발표한 수치와 같았다. 숫자가 다른 이유를 살펴보자 조사 시점과 대상, 계산 기준이 서로 다르다는 사실이 드러났다.”
AI의 답과 공식 통계가 다르다고 해서 곧바로 모든 자료 가운데 하나만 옳고 나머지는 틀렸다고 판단해서는 안 된다. 통계청의 4.8퍼센트는 지난달의 공식 실업률이고, 경제연구소의 4.5퍼센트는 올해 평균을 추정한 값이다. 민간 사이트의 6.1퍼센트는 전체 노동인구가 아니라 해당 사이트에 등록한 구직자를 기준으로 계산했다. 이 세 수치는 이름은 비슷하지만 대상과 기간, 계산 방식이 서로 다르다. 반면 AI가 제시한 4.2퍼센트는 과거 공식 수치를 현재 값처럼 전달했다는 점에서 최신성에 문제가 있다. ‘현재’라는 표현을 사용하려면 어느 시점의 자료인지 확인했어야 한다. 여러 자료를 비교하면 단순한 숫자 차이뿐 아니라 그 차이가 생긴 이유까지 이해할 수 있다.
비교할 자료는 가능한 한 서로 독립적이고 역할이 다른 것이 좋다. 정부의 공식 통계는 정해진 기준에 따른 전체 현황을 보여 주고, 연구기관의 분석은 수치의 배경이나 향후 가능성을 설명할 수 있다. 다만 연구기관의 추정값을 공식 통계와 같은 종류의 수치로 취급해서는 안 된다. AI의 답을 확인할 때는 최신 공식 자료를 우선 찾고 필요하면 연구 보고서나 다른 기관의 자료를 보완적으로 살펴볼 수 있다. 비교의 목적은 AI의 실수만 찾아내는 데 있지 않다. 하나의 짧은 답에 생략된 기준과 변화 과정, 서로 다른 해석을 보완하는 데에도 의미가 있다. 생성형 AI는 정보 탐색의 출발점으로 활용하되 중요한 결론은 확인 가능한 여러 근거를 바탕으로 내려야 한다.
정보를 정확하게 이해하려면 문장의 내용뿐 아니라 그 정보가 어디에서 왔는지를 함께 살펴봐야 한다. 확인 가능한 사실과 의견, 추정을 구별하고 강한 표현이 실제 근거보다 앞서 있지 않은지 확인할 필요가 있다. 원출처와 작성자, 작성 시점, 자료가 만들어진 목적도 정보의 의미를 판단하는 중요한 단서가 된다. 다른 곳에서 다시 전달된 정보라면 조건이나 맥락이 빠지지 않았는지 원자료와 비교해야 한다. 인터넷과 뉴스에서는 검색 순위와 제목, 반복되는 문장만으로 신뢰도를 판단해서는 안 된다. 생성형 AI의 답도 같은 기준으로 출처와 근거, 적용 조건과 최신성을 확인해야 한다. 정보를 잘 읽는다는 것은 모든 내용을 무조건 의심하는 일이 아니라 어디까지 확인되었으며 무엇을 더 확인해야 하는지를 구별하는 일이다.
