제8장 인공지능의 이해와 사회서비스 적용
4. 예측모델과 의사결정 지원
예측모델은 과거 자료에서 발견한 특징과 관계를 바탕으로 아직 확인되지 않은 결과가 나타날 가능성을 추정하는 도구이다. 모델의 결과는 대상의 종류, 발생 확률, 위험 점수나 추천 순위 등 다양한 형태로 제시될 수 있다. 예측은 앞으로 어떤 일이 일어날 가능성을 계산하는 과정이지만, 의사결정은 예측 결과와 함께 가치와 권리, 비용, 이용 가능한 자원과 전문가의 판단을 고려하여 행동을 선택하는 과정이므로 높은 예측정확도가 반드시 올바른 결정이나 바람직한 사회적 결과로 이어지는 것은 아니다. 따라서 예측모델을 의사결정에 활용할 때에는 모델의 성능과 한계를 이해하고 사람이 결과를 검토하여 최종 결정에 책임지는 절차를 마련해야 한다.
1) 예측모델의 개념
예측모델은 현재 이용할 수 있는 정보를 바탕으로 미래에 일어날 사건이나 아직 확인되지 않은 상태를 수치로 추정한다. 예측 대상은 서비스 이용 가능성, 특정 사건의 발생 여부, 예상 수요량과 필요한 자원의 규모 등 연구와 업무의 목적에 따라 달라진다. 모델은 입력 정보와 결과 사이에 나타난 통계적인 관계를 학습하지만 개별 사례에서 사건이 발생한 원인을 직접 밝혀 주는 것은 아니다. 앞으로 일어날 일을 예측하는 문제와 특정한 지원이 어떤 결과를 일으키는지 분석하는 문제는 질문과 분석 방법이 다르므로 구분해야 한다(Kleinberg et al., 2015). 예측할 결과가 실제 업무 목적을 제대로 나타내는지 확인하지 않으면 정확도가 높은 모델도 잘못 설정된 문제를 반복해서 처리할 수 있다. 예측모델의 성능은 개발에 사용한 자료뿐 아니라 새로운 지역과 시기, 기관과 집단에서도 유지되는지를 별도의 자료로 확인해야 한다. 모델이 사건이 발생한 사례와 발생하지 않은 사례를 얼마나 잘 구분하는지 살펴보고, 예측한 발생 가능성과 실제 발생 비율이 얼마나 일치하는지도 확인해야 한다. 전체적인 성능이 좋더라도 특정 집단이나 드물게 발생하는 상황에서는 오류가 커질 수 있으므로 집단별 성능과 결과의 불확실성을 함께 제시해야 한다. 또한 모델을 실제로 사용한뒤 대상 집단이나 업무 절차가 달라지면 성능도 변할 수 있으므로 정기적으로 다시 평가하고 필요한 경우 수정해야 한다.
2) 분류와 위험점수
분류모델은 입력된 사례를 미리 정한 두 개 이상의 집단 가운데 하나로 구분하는 모델이다. 이진분류는 ‘발생’과 ‘미발생’처럼 두 가지 결과를 다루고 다중분류는 서로 다른 세 가지 이상의 결과를 구분한다. 많은 분류모델은 처음부터 하나의 결과를 확정하지 않고 각 집단에 속할 가능성을 점수나 확률로 제시한다. 위험 점수는 특정 사건이 일정한 기간 안에 발생할 가능성을 연속적인 숫자나 여러 단계로 나타낸 것이다. 점수가 높다는 것은 다른 사례보다 사건이 발생할 가능성이 높다고 추정한 것이며 해당 사건이 반드시 발생한다는 뜻은 아니다. 연속적인 위험 점수를 실제 분류 결과로 바꾸려면 어느 점수 이상을 고위험으로 판단할 것인지 기준값을 정해야 한다. 기준값을 낮추면 위험한 사례를 더 많이 발견할 수 있지만 실제로 위험하지 않은 사람까지 고위험으로 잘못 분류할 가능성이 커진다. 반대로 기준값을 높이면 불필요한 개입은 줄어들 수 있지만 지원이 필요한 사람을 놓칠 가능성이 커진다. 따라서 모델이 위험한 사례를 얼마나 잘 구분하고 예측한 가능성과 실제 발생 비율이 얼마나 일치하는지 평가하는 동시에 각 오류가 당사자에게 미치는 영향, 개입의 이익과 손해 및 이용 가능한 자원을 고려하여 분류 기준을 결정해야 한다(Collins et al., 2024).
3) 추천과 우선순위 결정
추천시스템은 이용자의 특성과 과거 행동, 선호와 서비스의 내용을 분석하여 관련성이 높다고 판단되는 선택지를 제시하는 시스템이다. 내용 기반 추천은 이용자가 이전에 선호한 대상과 특징이 비슷한 항목을 찾고, 이용자 기반 추천은 비슷한 사람들의 선택 경향을 활용한다. 이용자와 항목 사이의 복잡한 관계를 몇 가지 공통 특징으로 단순화하면 직접 선택한 기록이 없는 항목에 대해서도 선호 가능성을 추정할 수 있다(Koren et al., 2009). 추천 결과는 일반적으로 하나의 정답이 아니라 이용자와의 관련성이나 예상되는 도움의 정도에 따라 순서를 정한 후보 목록이다. 다만 신규 이용자나 새롭게 등록된 서비스는 과거 이용 기록이 부족하여 적절한 추천이 어려울 수 있다. 우선순위 결정은 여러 대상 가운데 누구를 먼저 검토하거나 누구에게 제한된 자원을 먼저 배분할지를 정하는 과정이다. 예측 점수에 따라 사례의 순서를 정할 수 있지만 높은 점수가 반드시 지원 효과가 가장 크거나 욕구가 가장 긴급하다는 뜻은 아니다. 우선순위를 정할 때에는 위험 가능성뿐 아니라 욕구의 심각성, 예상되는 지원 효과, 서비스 접근 가능성, 공정성과 당사자의 선호를 함께 고려해야 한다. 과거 이용 기록에 지나치게 의존하면 기존 서비스를 많이 이용한 집단은 계속 추천되고 기록이 적은 집단은 배제될 수 있으므로, 추천과 순위는 선택을 돕는 참고자료로만 사용하고 누락된 사람을 찾는 별도의 방법과 판단 기준에 이의를 제기할 절차를 마련해야 한다.
4) 전문가 의사결정 지원
의사결정 지원 시스템은 전문가를 대신하여 결론을 내리는 것이 아니라 필요한 정보를 정리하고 위험 신호와 선택 가능한 방법을 제시하는 도구이다. 모델은 많은 기록을 빠르게 비교하고 사람이 놓치기 쉬운 반복적인 특징을 알려 주어 검토의 일관성과 효율성을 높일 수 있다. 전문가는 모델이 파악하지 못한 최근의 변화와 가족관계, 당사자의 진술, 지역자원과 문화적 상황을 함께 고려할 수 있다. 아동학대 신고의 우선순위를 정하는 연구에서는 행정 자료를 활용한 위험 예측모델이 담당자의 판단을 지원할 가능성과 함께 자료의 편향과 실제 현장에 적용할 때의 문제를 보여 주었다(Chouldechova et al., 2018). 이 사례는 의사결정 지원의 질이 인공지능의 정확도뿐 아니라 전문가가 결과를 이해하고 실제 업무에 활용하는 방식에 따라 달라진다는 점을 보여 준다. 전문가에게 점수만 제시하면 그 의미와 한계를 충분히 이해하지 못한 채 결과를 그대로 따르거나 반대로 신뢰하지 않고 무시할 수 있다. 효과적인 지원 화면에는 예측 결과와 함께 사용한 정보, 결과에 큰 영향을 미친 요인, 불확실성, 적절한 사용 범위와 자료의 수정 시점을 이해하기 쉽게 제시해야 한다. 전문가는 모델과 다른 결정을 내릴 권한을 가져야 하며 그 이유를 간단히 기록하면 오류를 분석하고 시스템을 개선하는 데 활용할 수 있다. 다만 사람이 마지막에 확인했다는 사실만으로 부적절한 자동 결정이 정당화되는 것은 아니므로 검토자가 실제로 판단할 시간과 정보, 권한을 갖도록 하고 교육과 정기적인 사례 검토를 통해 전문가의 판단과 모델의 오류를 함께 점검해야 한다.
5) 자동화된 결정과 인간의 검토
자동화된 결정은 사람이 개별 사례를 직접 검토하지 않은 상태에서 시스템이나 인공지능의 판단이 승인, 거절, 서비스 배정 등의 결과로 이어지는 방식이다. 자동화는 반복적이고 위험이 낮은 업무의 효율성과 일관성을 높일 수 있지만, 권리나 서비스 이용에 영향을 미치는 결정에서는 오류의 피해가 클 수 있다. 따라서 사람의 검토는 자동 결과를 형식적으로 승인하는 절차가 아니라 원자료와 개별 상황을 확인하고 필요하면 결정을 수정할 수 있는 실질적 개입이어야 한다. 자동화 결과를 과도하게 신뢰하면 잘못된 판단을 그대로 따르는 자동화 편향이 발생할 수 있다(Parasuraman & Riley, 1997). 자동화 수준은 오류의 영향, 결정의 가역성, 당사자의 권리와 전문가 개입 필요성을 고려하여 정해야 한다. 특히 위험이 큰 결정에서는 사람이 재검토하고 이의를 제기할 수 있는 절차와 최종 책임 주체를 명확히 해야 한다. 또한 인공지능의 위험은 개발부터 운영·종료까지 실제 사용 환경과 인간의 개입을 함께 고려하여 관리해야 한다(NIST, 2023). 궁극적으로 자동화는 인간의 책임을 대체하는 수단이 아니라 전문가의 판단을 지원하고 사람이 최종 통제와 책임을 유지하도록 설계되어야 한다.
