AI·로봇 시대의 돌봄서비스 054. 인공지능의 주요 기술

제8장 인공지능의 이해와 사회서비스 적용

2. 인공지능의 주요 기술

인공지능은 하나의 기술이 아니라 자료에서 특징과 관계를 학습하고 언어·음성·이미지 등의 정보를 처리하는 여러 기술의 결합체이다. 머신러닝과 딥러닝은 자료를 바탕으로 판단 모형을 만드는 공통 기반을 제공하고 자연어 처리, 음성 기술과 컴퓨터 비전은 이를 글과 말, 이미지 등의 특정한 정보 형태에 적용한다. 생성형 인공지능과 대규모 언어모델은 이러한 기술을 확장하여 이용자의 지시에 따라 새로운 글과 이미지, 음성 등의 콘텐츠를 만들어 낸다. 실제 인공지능 시스템은 한 가지 기술만 사용하기도 하지만 여러 기술을 연결하여 복합적인 기능을 수행하는 경우가 많으므로, 각 기술이 받아들이는 정보와 학습 방식, 생성 결과및 발생 가능한 오류를 구분하여 이해해야 한다.

1) 머신러닝

머신러닝은 컴퓨터가 사람이 미리 작성한 모든 규칙에 의존하지 않고 자료와 경험을 통해 주어진 업무의 수행 방법을 개선하는 기술이다. 이 분야는 경험을 쌓으면서 자동으로 성능이 향상되는 컴퓨터 시스템을 어떻게 만들 것인지를 다룬다(Jordan & Mitchell, 2015). 지도학습은 입력 자료와 정답의 관계를 학습하여 새로운 사례가 어떤 범주에 속하는지 또는 어떤 값이 나올지를 예측하는 방식이다. 비지도학습은 정답이 없는 자료에서 비슷한 사례의 집단과 자료에 숨어 있는 구조를 찾고, 강화학습은 행동의 결과로 얻는 보상을 바탕으로 더 나은 전략을 학습한다. 따라서 해결하려는 문제와 이용할 수 있는 자료의 특성에 맞게 학습 방식과 알고리즘을 선택해야 한다. 머신러닝의 개발 과정은 문제 정의, 자료 준비, 주요 특징과 예측 목표 설정, 모델 학습, 성능 평가와 현장 적용의 단계로 이루어진다. 학습된 모델은 과거의 학습 자료뿐 아니라 처음 접하는 사례에서도 적절한 결과를 내는 일반화 능력을 갖추어야 한다. 이를 확인하기 위해 학습에 사용하지 않은 검증 자료와 시험 자료를 활용하여 전체 예측의 정확성, 실제 대상을 찾아낸 비율, 예측한 대상이 실제로 맞은 비율과 오차 등을 측정한다. 평가 지표가 높더라도 실제 현장이 학습 환경과 다르거나 중요한 집단의 자료가 부족하면 성능이 낮아질 수 있으므로, 머신러닝을 객관적인 정답을 자동으로 찾는 장치가 아니라 자료와 인간의 설계 선택을 바탕으로 가능성을 판단하는 도구로 이해해야 한다.

2) 딥러닝

딥러닝은 정보를 입력받는 단계와 결과를 내보내는 단계 사이에서 여러 차례 정보를 분석하여 복잡한 관계를 학습하는 머신러닝 기술이다. 각 단계에서는 이전에 받은 정보 가운데 중요한 특징을 찾아 계산하고 그 결과를 다음 단계로 전달한다. 모델은 자신이 예측한 결과와 실제 정답의 차이를 확인한 뒤 오류를 줄이는 방향으로 내부의 계산 기준을 반복해서 조정한다. 이러한 과정을 통해 처음에는 선과 모양, 소리 같은 단순한 특징을 찾고 이후에는 사물의 종류나 문장의 의미 같은 복잡한 특징을 파악한다(Goodfellow et al., 2016). 따라서 딥러닝은 사람이 필요한 특징을 일일이 정하기 어려운 이미지, 음성, 영상과 언어 자료를 처리하는 데 특히 유용하다. 딥러닝에는 이미지의 모양과 위치를 파악하는 방식, 순서대로 이어지는 음성과 문장의 관계를 분석하는 방식, 여러 정보 가운데 중요한 부분에 선택적으로 집중하는 방식 등이 있다. 방대한 자료로 미리 학습한 모델의 지식을 새로운 업무에 활용하는 전이학습은 비교적 적은 자료와 시간으로도 모델을 개발할 수 있게 한다. 다만 구조와 계산 과정이 복잡해질수록 더 많은 자료와 컴퓨터 자원이 필요하며 모델이 특정한 결과를 내놓은 이유를 설명하기 어려워질 수 있다. 또한 학습을 성공적으로 마쳤더라도 기존 학습 자료와 다른 정보나 상황에서는 예상하지 못한 결과를 낼 수 있으므로 모델의 크기뿐 아니라 자료의 품질, 학습 조건, 평가방법과 실제 사용 환경을 함께 살펴야 한다.

3) 자연어처리

자연어 처리는 컴퓨터가 사람이 사용하는 말과 글을 분석하고 의미를 파악하거나 새로운 내용을 만들도록 하는 인공지능 기술이다. 컴퓨터는 글을 단어나 단어의 일부와 같은 작은 단위로 나눈 뒤 계산할 수 있는 숫자로 바꾸어 처리한다. 자연어 처리는 단어와 문장 구조를 분석하는 것부터 앞뒤 문맥의 의미, 말하는 사람의 의도와 여러 문서 사이의 관계를 파악하는 것까지 폭넓게 다룬다. 주요 기능에는 문서의 종류 구분, 긍정·부정 감정의 분석, 사람·장소·기관명 찾기, 필요한 정보 추출, 번역, 요약과 질문에 대한 답변 등이 있다. 같은 표현도 앞뒤 내용에 따라 의미가 달라지고 생략이나 비유, 반대의 뜻으로 말하는 표현이 사용되므로 단어를 단순히 비교하는 방식만으로 언어를 정확하게 처리하기는 어렵다. 초기의 자연어 처리 기술은 사람이 만든 문법 규칙과 사전에 주로 의존했지만 이후에는 많은 언어 자료에서 특징을 학습하는 통계적 방법과 인공신경망 기반의 언어모델이 중심이 되었다. 컴퓨터가 단어나 문장의 의미와 사용 상황을 숫자의 조합으로 나타내면 서로 비슷한 표현과 문맥의 관계를 계산하여 학습할 수 있다. 대규모 문장에서 앞뒤 문맥을 함께 학습한 언어모델인 버트(BERT)는 미리 학습한 하나의 모델을 문서 분류, 질의응답 등 여러 자연어 처리 업무에 맞게 추가로 학습하여 활용하는 방식을 확산시켰다(Devlin et al., 2019). 그러나 언어모델이 문법적으로 자연스러운 결과를 만들더라도 사람의 의도와 문화적 의미, 현실의 사실관계를 정확히 이해했다고 볼 수 없으며, 방언이나 신조어, 전문용어와 소수 언어가 학습 자료에 부족하면 집단과 상황에 따라 성능이 달라질 수 있다.

4) 음성인식과 음성합성

음성 인식은 사람이 말한 소리를 문자나 명령으로 바꾸는 기술이며, 음성 합성은 문자로 입력한 내용을 사람이 들을 수 있는 목소리로 바꾸는 기술이다. 음성 인식 시스템은 시간에 따라 달라지는 음파의 특징을 분석하여 이를 발음과 단어의 순서로 해석한다. 기존 시스템은 소리의 특징, 단어의 발음과 문장의 흐름을 각각 분석하는 여러 기능을 결합했지만, 딥러닝이 발전하면서 음성 자료를 문자로 직접 바꾸는 과정을 한 번에 학습하는 방식이 확대되었다(Hannun et al., 2014). 언어모델은 인식 가능한 여러 단어 가운데 앞뒤 문맥에 가장 자연스럽게 이어지는 표현을 선택하여 인식의 정확도를 높인다. 음성 인식의 성능은 실제로 말한 내용과 변환된 문자를 비교하여 단어가 추가되거나 빠지고 다른 단어로 바뀐 비율 등을 기준으로 평가한다. 음성 합성 시스템은 입력된 문장을 발음할 수 있는 단위로 나누고 말의 높낮이와 속도, 강조할 부분을 정한 뒤 음성을 생성한다. 딥러닝 기반의 음성 합성 기술은 문자와 음성이 짝을 이룬 자료를 학습하여 사람이 여러 단계를 직접 설계하지 않아도 자연스러운 음성을 만들 수 있음을 보여 주었다(Wang et al., 2017). 음성 기술의 실제 성능은 주변 소음과 마이크 상태, 말하는 속도, 억양, 연령, 장애 특성, 언어와 방언에 따라 달라질 수 있다. 특정인의 목소리를 재현하는 음성 복제 기술은 의사소통을 지원할 수 있지만 동의 없이 다른 사람을 사칭하거나 허위 정보를 만드는 데 악용될 위험도 있으므로, 중요한 대화와 기록에 사용할 때에는 변환 결과를 확인하고 오류를 수정하며 당사자의 동의와 음성정보 보호를 보장해야 한다.

5) 컴퓨터 비전

컴퓨터 비전은 디지털 이미지와 영상에서 사람이나 사물의 모양과 위치, 움직임과 관계를 분석하여 필요한 정보를 찾는 인공지능 기술이다. 영상 분류는 이미지 전체가 무엇을 나타내는지 구분하고, 객체 탐지는 이미지에 있는 여러 대상의 종류와 위치를 찾으며, 영상 분할은 이미지의 각 부분이 어떤 대상에 속하는지를 구별한다. 얼굴 인식, 사람의 자세 파악, 움직이는 대상의 추적과 이미지 속 문자를 읽는 기능도 컴퓨터 비전에 포함된다. 이미지 분석에 특화된 인공신경망은 가까이 있는 화소들의 관계를 분석하여 선과 질감, 형태 등의 특징을 단계적으로 학습하고 대규모 이미지 분류의 정확도를 크게 높였다(Krizhevsky et al., 2012). 최근에는 이미지의 멀리 떨어진 부분 사이의 관계를 분석하거나 이미지와 글을 함께 학습하여 관련 자료 검색과 이미지 설명 생성 등으로 기능을 확대하고 있다. 컴퓨터 비전은 촬영 각도와 조명, 화질, 가려진 부분과 배경의 영향을 받으므로 같은 대상도 촬영 조건에 따라 다르게 인식할 수 있다. 학습 자료에 특정한 환경이나 집단의 이미지가 지나치게 많이 포함되면 다른 환경과 집단에서 오류가 증가할 수 있다. 실제로 얼굴 인식 기술이 다른 사람을 특정 인물로 잘못 판단하거나 실제 인물을 인식하지 못하는 비율은 알고리즘과 인구집단에 따라 차이가 있는 것으로 나타났다(Grother et al., 2019). 또한 이미지에 특정 대상이 나타났다는 사실만으로 사람의 의도나 상황의 원인을 판단해서는 안 되므로 사람의 검토와 추가 정보가 필요하며, 얼굴과 신체, 생활공간이 포함된 영상은 민감한 개인정보가 될 수 있어 수집 목적과 접근 권한, 보관 기간을 엄격하게 관리해야 한다.

6) 생성형 AI와 대규모 언어모델

생성형 인공지능은 방대한 학습 자료에서 내용의 특징과 관계를 학습하여 이용자의 지시에 따라 새로운 글과 이미지, 음성, 영상과 프로그램 코드 등을 만드는 기술이다. 대규모 언어모델은 많은 글을 단어나 단어의 일부처럼 작은 단위로 나누고 앞에 나온 내용을 바탕으로 다음에 올 표현을 예측하는 과정을 반복하여 학습한다. 트랜스포머는 문장 안에서 서로 떨어져 있는 표현들의 관련성을 동시에 분석하여 방대한 자료를 효율적으로 학습할 수 있게 한다. 미리 학습한 모델은 지시문과 적절한 답변의 예시를 추가로 배우거나 사람들이 더 좋다고 평가한 답변을 반영하여 이용자의 요구를 잘 따르도록 조정할 수 있다(Ouyang et al., 2022). 이용자는 질문과 지시, 관련 정보, 예시와 원하는 답변 형식을 입력하여 인공지능이 결과를 생성하는 방향을 조절한다. 대규모 언어모델은 하나의 모델로 요약, 번역, 질의응답, 문서 분류와 초안 작성 등 다양한 업무를 수행할 수 있다. 그러나 저장된 문장을 그대로 검색하여 보여 주는 것이 아니라 다음에 올 표현을 가능성에 따라 선택하므로 같은 질문에도 설정이나 상황에 따라 다른 답변을 만들 수 있다. 외부 문서를 검색하여 관련 내용을 질문과 함께 모델에 제공하는 검색증강생성은 모델이 주어진 자료를 근거로 답변하도록 돕는 방법이다(Lewis et al., 2020). 검색증강생성을 사용하더라도 부적절하거나 잘못된 자료를 찾고 근거와 다른 내용을 생성할 수 있으므로, 결과를 완성된 판단으로 받아들이지 말고 사람이 출처와 사실을 확인하여 목적에 맞게 수정해야 하는 초안으로 이해해야 한다.

AI·로봇 시대의 돌봄서비스 표지
error: Content is protected !!