5.그래프는 모양보다 기준이 중요하다
그래프는 수치의 차이와 변화의 흐름을 시각적으로 보여 주기 때문에 복잡한 자료를 빠르게 이해하는 데 도움이 된다. 그러나 선의 기울기나 막대의 높이만 보고 의미를 판단하면 실제 값과 다른 인상을 받을 수 있다. 그래프를 읽을 때는 먼저 제목과 가로축, 세로축이 무엇을 나타내는지 확인해야 한다. 눈금의 간격과 단위, 축이 시작되는 값도 함께 살펴볼 필요가 있다. 같은 자료도 축의 범위를 어떻게 설정하느냐에 따라 차이가 크거나 작아 보일 수 있기 때문이다. 또한 그래프에 두 현상이 함께 나타나더라도 그 관계의 원인이나 개인별 차이까지 모두 알 수 있는 것은 아니다. 그래프를 정확하게 읽으려면 눈에 보이는 모양보다 그 모양을 만들어 낸 기준과 수치를 먼저 확인해야 한다.
1)가로축과 세로축
그래프의 의미를 파악하려면 먼저 가로축과 세로축이 무엇을 나타내는지 확인해야 한다. 가로축에는 연도와 같은 시간이나 지역, 연령, 집단과 같은 비교 대상이 놓일 수 있다. 세로축에는 사람 수, 금액, 시간, 비율처럼 측정한 값이 표시되는 경우가 많다. 가로축이 시간이라면 선의 움직임을 시간에 따른 변화로 읽을 수 있다. 그러나 가로축에 여러 집단이 놓여 있다면 각 집단의 수치를 같은 시점에서 비교하는 자료일 수 있다. 그래프의 모양이 비슷해 보여도 축에 무엇이 놓였는지에 따라 의미는 완전히 달라진다.
“한 보고서에는 모양이 비슷한 두 개의 선그래프가 실려 있었다. 첫 번째 그래프의 가로축에는 2022년부터 2026년까지의 연도가, 세로축에는 한 도시의 인구수가 표시되어 있었다. 선은 왼쪽에서 오른쪽으로 갈수록 점차 높아졌다. 두 번째 그래프의 가로축에는 가람동, 나래동, 다온동, 라온동이라는 지역명이, 세로축에는 주민 만족도가 표시되어 있었다. 두 번째 그래프의 선도 왼쪽에서 오른쪽으로 갈수록 대체로 높아지는 모양이었다. 한 독자는 두 그래프 모두 시간이 지나면서 수치가 증가한 자료라고 설명했다. 그러나 두 번째 그래프의 가로축은 시간이 아니라 서로 다른 지역을 나타내고 있었다.”

첫 번째 그래프에서는 가로축이 연도이므로 선의 움직임을 시간에 따른 변화로 읽을 수 있다. 선이 2022년에서 2026년으로 갈수록 높아졌다면 해당 도시의 인구가 그 기간에 증가했다는 뜻이다. 반면 두 번째 그래프의 가로축에는 서로 다른 지역의 이름이 놓여 있다. 따라서 선이 높아지는 모습은 시간이 지나면서 만족도가 상승했다는 뜻이 아니다. 가람동보다 나래동의 만족도가 높고, 나래동보다 다온동이나 라온동의 만족도가 높다는 식으로 지역을 비교해야 한다. 그래프의 모양만 보면 두 자료가 모두 상승세를 나타내는 것처럼 느껴질 수 있다. 그러나 축을 확인하면 첫 번째는 시간에 따른 변화이고 두 번째는 같은 시점의 지역별 차이라는 사실을 알 수 있다.
그래프에서 선이 이어져 있다는 사실만으로 값들이 시간 순서로 연결되었다고 생각해서도 안 된다. 비교 대상인 지역을 선으로 연결한 그래프라면 선의 기울기는 지역 간 수치 차이를 시각적으로 나타낼 뿐이다. 지역의 배열 순서를 바꾸면 선의 모양도 달라질 수 있으므로 이를 지속적인 상승 추세라고 해석할 수 없다. 그래프를 읽을 때는 ‘선이 올라갔다’고 바로 말하기보다 ‘가로축에서 무엇이 달라졌는가’를 먼저 확인해야 한다. 세로축에서는 어떤 수치가 측정되었는지와 그 단위도 함께 살펴야 한다. 축의 의미를 말로 풀어 본 뒤 그래프의 모양을 해석하면 잘못된 판단을 줄일 수 있다. 결국 그래프의 방향은 축이 무엇을 나타내는지를 알 때 비로소 의미를 갖는다.
2)눈금과 단위
그래프의 눈금은 선이나 막대가 나타내는 실제 수치를 읽는 기준이다. 눈금 한 칸이 1을 뜻하는지 100을 뜻하는지에 따라 같은 길이가 나타내는 변화량은 달라진다. 세로축의 단위가 명, 천 명, 퍼센트, 백만 원 가운데 무엇인지도 반드시 확인해야 한다. 축의 시작점과 끝점은 그래프에서 값의 차이가 얼마나 크게 보이는지에 영향을 준다. 따라서 막대의 길이나 선의 기울기만 보고 변화의 크기를 판단해서는 안 된다. 눈에 보이는 모양을 축에 표시된 숫자와 단위로 바꾸어 읽어야 정확한 의미를 알 수 있다.
“푸른시의 인구 변화를 나타낸 그래프에서 2025년의 값은 98, 2026년의 값은 100으로 표시되어 있었다. 한 학생은 인구가 두 명 늘었다고 설명했다. 그러나 세로축 위에는 ‘단위: 만 명’이라는 표시가 적혀 있었다. 따라서 98은 98만 명이고 100은 100만 명을 뜻했으며, 실제 증가 인구는 2만 명이었다. 그래프의 세로축은 0이 아니라 90에서 시작했고 눈금 한 칸은 2만 명을 나타냈다. 막대의 높이는 상당히 달라 보였지만 전체 인구를 기준으로 보면 증가 폭은 약 2퍼센트였다. 학생은 숫자만 읽을 때보다 단위와 눈금을 함께 읽을 때 변화의 의미가 달라진다는 사실을 알게 되었다.”

제시문의 98과 100은 단위를 제외하면 단순한 숫자에 불과하다. 세로축의 단위가 만 명이므로 두 값의 실제 차이는 두 명이 아니라 2만 명이다. 이처럼 단위는 숫자 뒤에 덧붙는 부수적인 표시가 아니라 수치의 규모를 결정하는 정보이다. 같은 100이라도 단위가 명이면 100명이고, 천 명이면 10만 명이며, 만 명이면 100만 명이 된다. 보고서나 기사에서는 공간을 줄이기 위해 단위를 그래프 제목이나 축 옆에 한 번만 표시하기도 한다. 따라서 각 숫자에 단위가 붙어 있지 않더라도 그래프 전체에 적용되는 단위를 찾아야 한다. 단위를 빠뜨리면 실제 변화의 규모를 크게 잘못 이해할 수 있다.
눈금의 간격과 세로축의 시작점도 그래프의 인상에 영향을 준다. 세로축이 90에서 시작하면 98과 100의 차이가 전체 막대에서 비교적 크게 보일 수 있다. 그러나 인구를 0부터 100만 명까지 표시하면 두 막대의 높이 차이는 훨씬 작게 보인다. 어느 경우에도 실제 값은 98만 명과 100만 명이며 차이는 2만 명으로 같다. 시각적인 차이가 커 보인다고 해서 실제 증가량이나 증가율까지 매우 큰 것은 아니다. 따라서 그래프를 볼 때는 막대가 몇 배 높아 보이는지를 따지기보다 축의 숫자를 이용해 실제 차이를 확인해야 한다. 눈금과 단위를 읽는 과정은 그래프의 시각적 인상을 수치의 의미로 바꾸는 과정이다.
3)그래프가 실제보다 크게 보이는 경우
그래프의 축을 좁게 설정하면 작은 차이도 매우 크게 보일 수 있다. 특히 세로축이 0이 아닌 높은 값에서 시작하면 막대 높이의 차이가 실제보다 두드러져 보인다. 이러한 그래프가 언제나 잘못된 것은 아니다. 값들의 미세한 차이를 자세히 보여 주기 위해 축의 범위를 좁힐 수도 있기 때문이다. 다만 축의 시작점과 범위를 확인하지 않으면 독자는 실제 수치보다 훨씬 큰 차이가 있다고 느낄 수 있다. 따라서 그래프의 모양과 함께 각 값의 차이, 단위, 축의 범위를 확인해야 한다.
“한 광고에는 A제품과 B제품의 사용자 만족도를 비교한 막대그래프가 제시되어 있었다. A제품의 만족도는 90퍼센트이고 B제품의 만족도는 92퍼센트였다. 첫 번째 그래프는 세로축을 0퍼센트부터 100퍼센트까지 표시하여 두 막대의 높이가 비슷하게 보였다. 두 번째 그래프는 같은 값을 사용하면서 세로축을 89퍼센트부터 93퍼센트까지만 표시했다. 두 번째 그래프에서는 B제품의 막대가 A제품의 막대보다 몇 배나 높아 보였다. 광고 문구에는 ‘B제품의 만족도가 압도적으로 높다’라고 적혀 있었다. 그러나 두 제품의 실제 만족도 차이는 어느 그래프에서도 2퍼센트포인트로 같았다.”

두 그래프는 서로 다른 조사 결과가 아니라 동일한 두 값을 다른 축으로 나타낸 것이다. A제품과 B제품의 만족도 차이는 92퍼센트에서 90퍼센트를 뺀 2퍼센트포인트이다. 첫 번째 그래프에서는 전체 비율의 범위인 0부터 100까지를 보여 주므로 두 값의 차이가 작게 나타난다. 두 번째 그래프에서는 89부터 93까지의 좁은 범위만 확대했기 때문에 작은 차이가 눈에 크게 들어온다. 그렇다고 두 번째 그래프의 수치가 거짓인 것은 아니다. 두 제품 사이의 미세한 차이를 자세히 관찰하려는 목적이라면 좁은 축이 도움이 될 수 있다. 문제는 축의 범위를 확인하지 않은 채 막대의 겉보기 차이를 실제 차이의 크기로 받아들이는 데 있다.
광고의 ‘압도적으로 높다’라는 표현도 실제 수치와 비교해 살펴봐야 한다. 막대 높이만 보면 B제품의 만족도가 A제품보다 매우 높은 것처럼 느껴질 수 있지만, 실제 차이는 2퍼센트포인트이다. 이 차이가 중요한지 판단하려면 조사 인원과 조사 방법, 오차의 범위 같은 추가 정보도 필요할 수 있다. 세로축을 0에서 시작하지 않은 그래프를 보았을 때는 먼저 축이 어디에서 시작하는지 확인해야 한다. 그런 다음 막대의 시각적인 길이가 아니라 막대 위의 실제 값을 빼서 차이를 계산하는 것이 좋다. 축을 좁게 설정한 이유가 세부 차이를 보여 주기 위한 것인지, 차이를 과장해 보이게 하려는 것인지도 자료의 목적과 함께 살펴볼 수 있다. 그래프의 인상보다 실제 수치를 우선해서 읽는 습관이 필요한 이유이다.
4)그래프가 보여 주지 않는 정보
그래프는 복잡한 자료 가운데 선택된 내용을 간단한 형태로 보여 준다. 따라서 그래프에 나타난 수치를 통해 확인할 수 있는 내용과 그래프만으로는 알 수 없는 내용을 구별해야 한다. 두 현상이 함께 증가하거나 감소하는 모습이 나타나더라도 하나가 다른 하나의 원인이라고 바로 판단할 수는 없다. 평균값을 나타낸 그래프에서는 집단 안의 개인별 차이나 수치의 분포가 가려질 수 있다. 특정 기간만 제시되었다면 그 이전과 이후의 장기적인 흐름도 알기 어렵다. 그래프를 정확하게 해석하려면 눈에 보이는 변화뿐 아니라 빠져 있는 정보와 추가로 필요한 자료도 생각해야 한다.
“한 연구 보고서에는 학생들의 하루 평균 공부 시간과 평균 시험 점수를 함께 나타낸 그래프가 실려 있었다. 하루 평균 공부 시간이 한 시간인 집단의 평균 점수는 65점, 두 시간인 집단은 72점, 세 시간인 집단은 78점, 네 시간인 집단은 82점이었다. 그래프에서는 공부 시간이 긴 집단일수록 평균 점수도 높은 경향이 나타났다. 보고서를 읽은 한 사람은 공부 시간을 한 시간 늘리면 누구나 점수가 반드시 오른다고 결론 내렸다. 그러나 그래프에는 학생들의 학습 방법, 이전 성적, 수면 시간, 수업 참여도는 제시되어 있지 않았다. 각 집단 안에서 학생들의 점수가 얼마나 다양하게 분포했는지도 그래프만으로는 알 수 없었다. 연구자는 이 그래프가 공부 시간과 평균 점수의 관련성을 보여 줄 뿐 모든 학생에게 같은 인과관계가 성립함을 증명하지는 않는다고 설명했다.”

그래프에서 직접 확인할 수 있는 것은 공부 시간이 긴 집단일수록 평균 시험 점수도 높게 나타났다는 점이다. 이는 두 현상 사이에 일정한 관련성이 있음을 보여 줄 수 있다. 그러나 공부 시간이 늘어난 것이 점수 상승의 직접적인 원인이라고 그래프만으로 확정할 수는 없다. 원래 학습 동기가 높은 학생들이 공부를 더 오래 하고 수업에도 적극적으로 참여했을 가능성이 있다. 효과적인 학습 방법이나 충분한 수면처럼 다른 요인이 공부 시간과 성적에 함께 영향을 주었을 수도 있다. 따라서 ‘함께 높아졌다’는 사실과 ‘하나가 다른 하나를 높였다’는 판단을 구별해야 한다. 인과관계를 확인하려면 다른 조건을 고려한 추가 연구가 필요하다.
평균값은 각 집단을 하나의 수치로 간단하게 보여 주지만 집단 안의 모든 학생이 그 점수를 받았다는 뜻은 아니다. 공부 시간이 네 시간인 집단의 평균이 82점이어도 일부 학생은 그보다 훨씬 낮거나 높은 점수를 받았을 수 있다. 개인별 점수의 범위와 분포가 제시되지 않았다면 학생들 사이의 차이가 얼마나 큰지 알 수 없다. 또한 이 그래프가 특정 학교의 학생만 조사한 것이라면 다른 학교나 연령대에도 같은 경향이 나타난다고 단정할 수 없다. 그래프를 읽은 뒤에는 ‘이 자료에서 직접 확인되는 사실은 무엇인가’와 ‘추가 자료가 있어야 판단할 수 있는 내용은 무엇인가’를 나누어 보는 것이 좋다. 그래프가 보여 주지 않는 정보를 의식하면 눈에 보이는 관계를 필요 이상으로 확대하지 않게 된다. 정확한 그래프 읽기는 제시된 수치를 이해하는 일과 그 수치의 한계를 확인하는 일을 함께 포함한다.
