<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0">
  <channel>
    <title>생활속 기초 통계 이해</title>
    <link>https://dailyworklog.tistory.com/</link>
    <description>개념을 쉽게 설명하는 것을 목표로 합니다. 가능한 한 공신력 있는 기관의 자료와 공개 데이터를 바탕으로 작성하며, 어려운 전문 용어는 쉬운 표현으로 풀어 설명합니다. 또한 특정 결과를 단정적으로 해석하기보다 통계가 의미하는 범위와 한계를 함께 소개하여 균형 있는 정보를 제공합니다.</description>
    <language>ko</language>
    <pubDate>Wed, 12 Aug 2026 09:30:40 +0900</pubDate>
    <generator>TISTORY</generator>
    <ttl>100</ttl>
    <managingEditor>그래프 한입</managingEditor>
    <item>
      <title>독립사건 종속사건 차이, 확률 구분</title>
      <link>https://dailyworklog.tistory.com/110</link>
      <description>&lt;h2 data-ke-size=&quot;size26&quot;&gt;독립사건과 종속사건은 무엇이 다른가요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;두 사건이 함께 일어날 확률을 계산하기 전에는 곱셈부터 할 것이 아니라 한 사건의 발생이 다른 사건의 가능성을 바꾸는지 살펴봐야 합니다. A가 일어났다는 정보를 알기 전과 후에 B의 확률이 같다면 두 사건은 독립입니다. 반대로 그 정보를 반영했을 때 B의 확률이 달라지면 종속 관계입니다. 사건의 이름이나 발생 순서가 아니라 확률을 만들어 낸 조건의 변화가 판단 기준입니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;조건부확률 P(B|A)는 A가 일어났다는 조건 아래에서 B가 일어날 확률을 뜻합니다. 독립인 경우에는 P(B|A)=P(B)가 성립합니다. OpenStax의 대학 통계 교재도 한 사건의 발생이 다른 사건의 발생 확률에 영향을 주지 않을 때 두 사건을 독립이라고 설명합니다. &lt;a href=&quot;https://openstax.org/books/introductory-statistics-2e/pages/3-2-independent-and-mutually-exclusive-events&quot; target=&quot;_blank&quot; rel=&quot;noopener noreferrer&quot;&gt;OpenStax 독립사건 설명&lt;/a&gt;에서 정의와 예시를 함께 확인할 수 있습니다.&lt;/p&gt;
&lt;table style=&quot;width: 100%; border-collapse: collapse; margin: 16px 0;&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;thead&gt;
&lt;tr&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;사건의 관계&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;A 발생 후 B의 확률&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;대표적인 시행&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;함께 일어날 확률&lt;/th&gt;&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;독립사건&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;원래 확률과 같음&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;공정한 동전을 두 번 던지기&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;P(A)×P(B)&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;종속사건&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;원래 확률과 달라짐&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;공을 돌려놓지 않고 두 번 꺼내기&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;P(A)×P(B|A)&lt;/td&gt;&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;

&lt;h2 data-ke-size=&quot;size26&quot;&gt;한 사건이 다음 가능성을 바꾸는지 어떻게 판별하나요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;실제 문제에서는 “A가 일어났다는 사실을 알면 B의 분모나 유리한 경우의 수가 바뀌는가?”라고 물으면 판단하기 쉽습니다. 공, 카드, 제품처럼 한정된 대상을 뽑는 상황이라면 첫 선택 뒤 남은 대상의 수와 구성을 적어 봅니다. 사람을 대상으로 한 조사라면 앞 질문이 뒤 응답에 영향을 주었는지, 특정 응답자만 다음 질문에 답하도록 설계되었는지도 확인해야 합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;복원 여부는 특히 유용한 단서입니다. 꺼낸 물건을 원래 자리에 돌려놓고 충분히 섞으면 다음 선택의 구성이 처음과 같아질 수 있습니다. 돌려놓지 않으면 전체 개수와 구성 비율이 달라지므로 대개 종속사건이 됩니다. 다만 복원했다는 사실만으로 모든 상황이 자동으로 독립이 되는 것은 아닙니다. 추첨 방식이나 시행 환경이 앞선 결과에 따라 달라진다면 다음 확률도 다시 검토해야 합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;시간 순서가 있다는 이유만으로 종속이라고 단정해서도 안 됩니다. 동전을 연달아 던져도 첫 결과가 두 번째 동전의 물리적 조건을 바꾸지 않는다면 두 시행은 독립으로 볼 수 있습니다. 반대로 결과가 무작위로 보이더라도 비복원 추출처럼 앞선 선택이 남은 표본을 바꾸면 종속입니다. 통계에서 중요한 것은 막연한 관련성의 인상이 아니라 조건을 적용했을 때 확률값이 실제로 변하는지입니다.&lt;/p&gt;

&lt;h2 data-ke-size=&quot;size26&quot;&gt;동전 던지기와 비복원 추출은 어떻게 달라지나요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;공정한 동전을 두 번 던지는 가상 실험을 생각해 보겠습니다. 앞면을 H, 뒷면을 T로 쓰면 가능한 순서쌍은 HH, HT, TH, TT입니다. 네 경우는 각각 1/4의 확률을 가지며, 첫 번째 결과가 H였다는 사실을 알아도 두 번째가 H일 확률은 1/2로 그대로입니다. 앞선 결과가 다음 시행의 표본공간을 줄이지 않았기 때문입니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이번에는 빨간 공 2개와 파란 공 1개가 든 주머니에서 공을 하나씩 두 번 꺼내되, 첫 공을 돌려놓지 않는 장면을 표로 기록해 봅니다. 첫 번째에 빨간 공이 나오기 전에는 빨간 공을 뽑을 확률이 2/3입니다. 실제로 빨간 공 하나를 꺼내 옆에 두면 주머니에는 빨간 공 1개와 파란 공 1개만 남습니다. 눈앞의 남은 구성을 세어 보면 두 번째 빨간 공의 확률이 1/2로 바뀌었다는 사실을 바로 확인할 수 있습니다.&lt;/p&gt;
&lt;table style=&quot;width: 100%; border-collapse: collapse; margin: 16px 0;&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;thead&gt;
&lt;tr&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;가상 실험&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;처음의 목표 확률&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;첫 결과를 안 뒤의 다음 확률&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;판정&lt;/th&gt;&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;공정한 동전을 두 번 던져 앞면 확인&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;두 번째 앞면 1/2&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;첫 번째가 앞면이어도 1/2&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;독립&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;빨간 공 2개와 파란 공 1개를 비복원 추출&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;빨간 공 2/3&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;첫 번째가 빨간 공이면 1/2&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;종속&lt;/td&gt;&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;두 공이 모두 빨간색일 확률은 2/3×1/2=1/3입니다. 두 번째에도 처음 확률 2/3을 그대로 넣어 4/9로 계산하면 첫 선택으로 표본 구성이 달라졌다는 조건을 놓친 셈입니다. 경우의 수를 적을 때 색깔 결과만 나열하지 말고 각 선택 뒤에 남은 공의 수까지 함께 기록해야 종속 관계가 계산에 제대로 반영됩니다.&lt;/p&gt;

&lt;h2 data-ke-size=&quot;size26&quot;&gt;두 사건이 함께 일어날 확률은 어떤 순서로 계산하나요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;두 사건이 모두 일어나는 교집합의 일반적인 곱셈법칙은 P(A∩B)=P(A)×P(B|A)입니다. A가 일어날 확률에 A가 일어난 조건에서 B가 일어날 확률을 곱하는 방식입니다. 두 사건이 독립이면 P(B|A)=P(B)이므로 P(A∩B)=P(A)×P(B)로 단순해집니다. 이 관계는 펜실베이니아주립대학교의 확률론 교육 자료에서도 조건부확률과 곱셈법칙으로 제시됩니다. &lt;a href=&quot;https://online.stat.psu.edu/stat414/lesson/2/2.1&quot; target=&quot;_blank&quot; rel=&quot;noopener noreferrer&quot;&gt;Penn State STAT 414 조건부확률 자료&lt;/a&gt;를 참고할 수 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;계산 순서는 네 가지 질문으로 정리할 수 있습니다. 두 사건이 모두 일어난다는 말이 구체적으로 어떤 결과인지 정하고, 첫 시행의 확률을 구한 뒤, 첫 결과가 반영된 두 번째 시행의 구성을 다시 확인합니다. 그 상태에서 조건부확률을 계산해 곱합니다. 독립이라는 사실이 확인된 경우에만 두 번째 항을 원래 확률로 바꾸면 됩니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;카드 추첨, 재고 표본검사, 좌석 배정처럼 한 번의 선택이 남은 대상을 줄이는 상황도 같은 원리로 해석할 수 있습니다. 분모가 줄어드는 것만 볼 것이 아니라 유리한 대상의 수도 함께 달라지는지 살펴야 합니다. 확률의 곱셈은 계산 도구일 뿐이며, 어떤 값을 곱해야 하는지는 자료가 만들어진 방식이 결정합니다.&lt;/p&gt;

&lt;h2 data-ke-size=&quot;size26&quot;&gt;서로 배반인 사건과 독립사건은 왜 다른가요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;서로 배반인 사건은 동시에 일어날 수 없는 사건입니다. 한 번의 동전 던지기에서 앞면이 나오는 사건과 뒷면이 나오는 사건이 그 예입니다. 앞면이 나왔다는 사실을 알면 뒷면일 확률은 0이 됩니다. 두 사건의 확률이 모두 0보다 크다면 한 사건의 발생이 다른 사건의 가능성을 바꾼 것이므로 독립이 아닙니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;독립은 두 사건이 함께 일어날 수 있으면서도 한쪽의 발생 정보가 다른 쪽 확률을 바꾸지 않는 관계입니다. 따라서 “동시에 일어날 수 없는가”는 서로 배반을 묻는 질문이고, “한 사건을 알았을 때 다른 사건의 확률이 달라지는가”는 독립 여부를 묻는 질문입니다. 질문을 분리하면 두 개념을 섞는 오류를 피할 수 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;정리하면 독립사건과 종속사건을 가르는 핵심은 앞선 사건 뒤에도 다음 확률이 유지되는지입니다. 복원 방식, 남은 표본의 구성, 조사 절차를 확인한 뒤 조건부확률을 비교해야 합니다. 통계는 공식을 외워 빠르게 대입하는 과목이라기보다 생활 속 숫자가 어떤 조건에서 만들어졌으며 어디까지 해석할 수 있는지를 판단하는 도구에 가깝습니다.&lt;/p&gt;</description>
      <category>곱셈법칙</category>
      <category>교집합</category>
      <category>독립사건</category>
      <category>동전던지기</category>
      <category>복원추출</category>
      <category>비복원추출</category>
      <category>서로배반사건</category>
      <category>조건부확률</category>
      <category>종속사건</category>
      <category>확률계산</category>
      <author>그래프 한입</author>
      <guid isPermaLink="true">https://dailyworklog.tistory.com/110</guid>
      <comments>https://dailyworklog.tistory.com/110#entry110comment</comments>
      <pubDate>Wed, 12 Aug 2026 00:50:48 +0900</pubDate>
    </item>
    <item>
      <title>표준점수 계산법, 과목 성적 비교</title>
      <link>https://dailyworklog.tistory.com/109</link>
      <description>&lt;h2 data-ke-size=&quot;size26&quot;&gt;원점수보다 표준점수를 함께 봐야 하는 이유&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;국어 85점과 수학 80점만 놓고 보면 국어 성적이 더 좋아 보입니다. 그러나 평균과 점수 분포가 다른 시험에서는 5점 차이만으로 어느 과목의 상대적 성취가 더 높은지 판단하기 어렵습니다. 원점수는 문항을 얼마나 맞혔는지 보여 주고, 표준점수는 그 점수가 기준 집단의 평균에서 얼마나 떨어져 있는지 보여 줍니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;가장 기본적인 표준화 값은 z점수입니다. 계산식은 &lt;b&gt;z점수=(개인 원점수-집단 평균)&amp;divide;표준편차&lt;/b&gt;입니다. z점수가 0이면 평균과 같고, 양수이면 평균보다 높으며, 음수이면 평균보다 낮습니다. 1.0은 평균보다 표준편차 1개만큼 높은 점수라는 뜻입니다. 평균과 표준편차를 이용해 관측값의 상대적 위치를 표현한다는 개념은 &lt;a href=&quot;https://kostat.go.kr/&quot; target=&quot;_blank&quot; rel=&quot;noopener noreferrer&quot;&gt;통계청&lt;/a&gt;의 통계용어 자료에서도 확인할 수 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;표준점수는 서로 다른 점수 척도를 공통 기준으로 바꾸는 데 유용하지만, 그 자체가 석차나 백분위를 뜻하지는 않습니다. 점수 분포가 한쪽으로 치우치거나 극단값이 많은 경우에는 z점수가 같아도 실제 상위 비율이 다를 수 있습니다. 정확한 석차나 백분위가 필요하다면 전체 점수의 누적 분포를 따로 확인해야 합니다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;pexels-votso-sothu-53802751-22915923.jpg&quot; data-origin-width=&quot;4000&quot; data-origin-height=&quot;5000&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dT7lLo/dJMcai5krhm/kTwhjBAECUh1WQqvkpy8HK/img.jpg&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dT7lLo/dJMcai5krhm/kTwhjBAECUh1WQqvkpy8HK/img.jpg&quot; data-alt=&quot;수업중 학생&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dT7lLo/dJMcai5krhm/kTwhjBAECUh1WQqvkpy8HK/img.jpg&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdT7lLo%2FdJMcai5krhm%2FkTwhjBAECUh1WQqvkpy8HK%2Fimg.jpg&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;338&quot; height=&quot;423&quot; data-filename=&quot;pexels-votso-sothu-53802751-22915923.jpg&quot; data-origin-width=&quot;4000&quot; data-origin-height=&quot;5000&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;수업중 학생&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;두 과목에 표준점수 계산법을 적용하면&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;같은 학생이 국어 85점, 수학 80점을 받았다고 가정해 보겠습니다. 두 시험은 모두 100점 만점이지만 국어 평균은 75점, 표준편차는 10점이고 수학 평균은 60점, 표준편차는 8점입니다. 아래 표는 과목을 행으로 두고 원점수, 집단 통계와 계산 결과를 열로 나누어 비교한 것입니다.&lt;/p&gt;
&lt;table style=&quot;width: 100%; border-collapse: collapse; margin: 16px 0;&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;과목&lt;/th&gt;
&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;원점수&lt;/th&gt;
&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;집단 평균&lt;/th&gt;
&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;표준편차&lt;/th&gt;
&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;z점수 계산&lt;/th&gt;
&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;z점수&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;국어&lt;/td&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;85점&lt;/td&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;75점&lt;/td&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;10점&lt;/td&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;(85-75)&amp;divide;10&lt;/td&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;1.0&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;수학&lt;/td&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;80점&lt;/td&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;60점&lt;/td&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;8점&lt;/td&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;(80-60)&amp;divide;8&lt;/td&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;2.5&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;원점수에서는 국어가 5점 높지만, 기준 집단 안에서 평균과 떨어진 정도는 수학이 더 큽니다. 국어는 평균보다 표준편차 1개만큼 높고 수학은 2.5개만큼 높기 때문입니다. 같은 성격의 응시 집단과 같은 시기의 평가라는 조건이 충족된다면, 이 학생의 상대적 성취는 수학에서 더 두드러졌다고 읽을 수 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 결과만 보고 수학 시험이 국어 시험보다 더 어려웠다고 단정해서는 안 됩니다. 확인된 사실은 수학 평균이 더 낮고 학생의 점수가 수학 분포의 평균에서 더 멀리 떨어져 있다는 점입니다. 시험 난도에는 문항 구성, 응시자 수준, 만점자 비율과 점수 분포 형태도 영향을 주므로 별도 자료가 필요합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;실제로 값을 다시 계산할 때는 산출 기관이 모집단 표준편차와 표본 표준편차 가운데 무엇을 사용했는지도 확인해야 합니다. 전체 응시자를 하나의 모집단으로 다룬 값과 일부 자료로 전체를 추정한 표본 표준편차는 분모가 달라 결과에 차이가 생길 수 있습니다. 성적표에 표준편차의 정의가 없으면 시행기관의 산출 지침을 우선 확인하는 편이 안전합니다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;04e4aa61-4d2e-4d28-852a-b06707028e25.png&quot; data-origin-width=&quot;1536&quot; data-origin-height=&quot;1024&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/op8nm/dJMcadv87Na/3irPYLDs64OLKejzS0sEKK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/op8nm/dJMcadv87Na/3irPYLDs64OLKejzS0sEKK/img.png&quot; data-alt=&quot;표준점수 계산법 &amp;amp;amp; 과목성적 비교&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/op8nm/dJMcadv87Na/3irPYLDs64OLKejzS0sEKK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fop8nm%2FdJMcadv87Na%2F3irPYLDs64OLKejzS0sEKK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;759&quot; height=&quot;506&quot; data-filename=&quot;04e4aa61-4d2e-4d28-852a-b06707028e25.png&quot; data-origin-width=&quot;1536&quot; data-origin-height=&quot;1024&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;표준점수 계산법 &amp;amp; 과목성적 비교&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;z점수와 성적표의 표준점수는 같은가&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;z점수에는 음수와 소수가 자주 나타납니다. 이를 읽기 쉬운 눈금으로 바꾼 대표적인 값이 평균 50, 표준편차 10인 T점수이며 계산식은 &lt;b&gt;T점수=50+10&amp;times;z점수&lt;/b&gt;입니다. 위 사례에서 국어의 T점수는 60, 수학은 75가 됩니다. 숫자의 모양은 달라져도 두 점수가 평균에서 떨어진 상대적 위치는 바뀌지 않습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;교육 평가에서 성적표에 적힌 &amp;lsquo;표준점수&amp;rsquo;가 언제나 단순한 z점수나 T점수인 것은 아닙니다. 시험 시행기관은 평가 목적에 맞춰 평균과 표준편차의 기준값, 반올림 방법, 점수 범위와 보정 절차를 별도로 정할 수 있습니다. 국가 수준 교육평가와 시험별 자료는 &lt;a href=&quot;https://www.kice.re.kr/&quot; target=&quot;_blank&quot; rel=&quot;noopener noreferrer&quot;&gt;한국교육과정평가원&lt;/a&gt;이 공개한 해당 시험의 안내와 채점&amp;middot;성적 산출 자료를 기준으로 해석해야 합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서 공식 성적을 개인이 재현하려면 원점수와 평균만으로 임의 계산하지 말고, 어느 집단의 통계를 썼는지와 공개된 변환식을 함께 살펴야 합니다. 표시된 표준점수와 직접 계산한 z점수가 다르다고 해서 곧바로 오류라고 볼 수 없는 이유입니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;과목 비교가 성립하는 조건과 주의점&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;표준화했다고 해서 모든 과목을 곧바로 비교할 수 있는 것은 아닙니다. 한 과목은 전국 응시자를 기준으로 하고 다른 과목은 한 학교 학생만 기준으로 했다면 같은 z점수도 비교 범위가 다릅니다. 학년, 응시 시기와 평가 목적이 크게 다른 경우에도 &amp;lsquo;누구와 비교한 점수인지&amp;rsquo;를 분리해서 읽어야 합니다.&lt;/p&gt;
&lt;table style=&quot;width: 100%; border-collapse: collapse; margin: 16px 0;&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;점검 항목&lt;/th&gt;
&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;비교하기 적절한 조건&lt;/th&gt;
&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;해석에 주의할 조건&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;기준 집단&lt;/td&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;같거나 성격이 유사한 응시자 집단&lt;/td&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;전국 응시자와 한 학급처럼 범위가 다른 집단&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;평가 시기와 목적&lt;/td&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;비슷한 시기의 상대적 성취를 비교하는 평가&lt;/td&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;서로 다른 능력 전체의 우열을 정하려는 비교&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;산출 방식&lt;/td&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;변환식과 반올림 기준이 확인된 점수&lt;/td&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;공식이나 표준편차의 정의가 공개되지 않은 점수&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;점수 분포&lt;/td&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;응시자 수가 충분하고 평균과 표준편차가 유효한 분포&lt;/td&gt;
&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;응시자가 적거나 극단값과 쏠림이 큰 분포&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;표준편차가 작으면 평균과의 작은 원점수 차이도 큰 z점수로 바뀝니다. 반대로 점수가 넓게 퍼진 시험에서는 같은 원점수 차이가 상대적으로 작게 표현됩니다. 모든 응시자의 점수가 같아 표준편차가 0이라면 나눗셈 자체가 불가능하므로 z점수를 계산할 수 없습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;성적표를 읽을 때는 원점수, 평균, 표준편차, 기준 집단과 산출 공식을 한 묶음으로 보는 것이 좋습니다. 학습 보완점을 찾을 때는 문항별 정오와 원점수가 더 직접적인 자료이고, 집단 안에서 과목별 상대적 강점을 살필 때는 표준점수가 유용합니다. 어느 숫자가 더 &amp;lsquo;진짜 성적&amp;rsquo;인 것이 아니라, 질문에 맞는 지표가 다릅니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;국어 85점과 수학 80점의 사례가 보여 주는 핵심도 여기에 있습니다. 원점수는 국어에서 더 높았지만, 해당 집단의 평균과 분산을 반영한 상대적 위치는 수학에서 더 높았습니다. 통계는 공식을 외워 결론을 대신하는 장치가 아니라, 서로 다른 숫자를 어떤 조건까지 비교할 수 있는지 판단하는 도구입니다.&lt;/p&gt;</description>
      <category>t점수</category>
      <category>Z점수</category>
      <category>과목성적비교</category>
      <category>교육평가</category>
      <category>상대적성취</category>
      <category>성적표해석</category>
      <category>원점수</category>
      <category>집단평균</category>
      <category>표준점수</category>
      <category>표준편차</category>
      <author>그래프 한입</author>
      <guid isPermaLink="true">https://dailyworklog.tistory.com/109</guid>
      <comments>https://dailyworklog.tistory.com/109#entry109comment</comments>
      <pubDate>Mon, 10 Aug 2026 14:40:20 +0900</pubDate>
    </item>
    <item>
      <title>심슨의 역설 사례, 합격률 뒤집힘</title>
      <link>https://dailyworklog.tistory.com/108</link>
      <description>&lt;h2 data-ke-size=&quot;size26&quot;&gt;학과별 합격률과 전체 합격률은 왜 다르게 보일까요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;심슨의 역설은 하위 집단에서 관찰된 비교 방향이 자료를 합쳤을 때 약해지거나 반대로 나타나는 현상입니다. 스탠퍼드 철학 백과의 설명처럼, 전체 자료의 연관성과 집단별 연관성이 충돌할 수 있으므로 어떤 변수를 기준으로 자료를 묶었는지 함께 살펴야 합니다. 계산이 틀려서 생기는 현상이 아니라 서로 다른 구성 비율이 전체 결과에 반영된 것입니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;가상의 대학에 합격하기 어려운 A학과와 비교적 합격하기 쉬운 B학과가 있다고 가정하겠습니다. 표의 행은 학과와 성별 조합으로 나누고, 열에는 합격자 수·지원자 수·합격률을 서로 겹치지 않게 배치했습니다. 각 학과 안에서는 남성 지원자의 합격률이 더 높지만, 남성은 A학과에, 여성은 B학과에 훨씬 많이 지원한 상황입니다. 실제 대학이나 특정 집단을 설명하는 자료는 아닙니다.&lt;/p&gt;
&lt;table style=&quot;width: 100%; border-collapse: collapse; margin: 16px 0;&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;caption&gt;학과와 성별로 나눈 가상 합격 자료&lt;/caption&gt;
&lt;thead&gt;
&lt;tr&gt;&lt;th scope=&quot;col&quot; style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;지원 학과&lt;/th&gt;&lt;th scope=&quot;col&quot; style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;지원자 성별&lt;/th&gt;&lt;th scope=&quot;col&quot; style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;합격자 수&lt;/th&gt;&lt;th scope=&quot;col&quot; style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;지원자 수&lt;/th&gt;&lt;th scope=&quot;col&quot; style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;학과별 합격률&lt;/th&gt;&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;A학과&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;남성&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;20명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;100명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;20%&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;A학과&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;여성&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;3명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;20명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;15%&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;B학과&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;남성&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;18명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;20명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;90%&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;B학과&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;여성&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;80명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;100명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;80%&lt;/td&gt;&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;A학과에서는 남성 20%, 여성 15%이고 B학과에서는 남성 90%, 여성 80%입니다. 같은 학과끼리 비교하면 남성 합격률이 각각 5%포인트와 10%포인트 높습니다. 여기까지만 읽으면 전체 결과도 같은 방향일 것이라고 예상하기 쉽습니다.&lt;/p&gt;

&lt;h2 data-ke-size=&quot;size26&quot;&gt;자료를 합치면 합격률은 어떻게 뒤집힐까요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;전체 합격률은 학과별 합격률 두 개를 더해 2로 나눈 단순 평균이 아닙니다. 성별로 합격자 수와 지원자 수를 각각 합산한 다음, 합격자 합계를 지원자 합계로 나누어야 합니다. 실제로 원자료 옆에 계산 칸을 두고 남성의 두 행과 여성의 두 행을 차례로 합친다고 생각하면 뒤집힘이 선명하게 드러납니다.&lt;/p&gt;
&lt;table style=&quot;width: 100%; border-collapse: collapse; margin: 16px 0;&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;caption&gt;학과 구분을 합친 성별 전체 합격 자료&lt;/caption&gt;
&lt;thead&gt;
&lt;tr&gt;&lt;th scope=&quot;col&quot; style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;지원자 성별&lt;/th&gt;&lt;th scope=&quot;col&quot; style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;전체 합격자 수&lt;/th&gt;&lt;th scope=&quot;col&quot; style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;전체 지원자 수&lt;/th&gt;&lt;th scope=&quot;col&quot; style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;전체 합격률&lt;/th&gt;&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;남성&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;38명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;120명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;약 31.7%&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;여성&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;83명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;120명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;약 69.2%&lt;/td&gt;&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;남성은 20명과 18명을 합친 38명을 120명으로 나누어 약 31.7%가 됩니다. 여성은 3명과 80명을 합친 83명을 120명으로 나누어 약 69.2%입니다. 학과별 비교에서는 남성이 앞섰지만 전체 비교에서는 여성이 약 37.5%포인트 앞섭니다. 하위 집단마다 성립한 방향이 전체 통계에서 반대로 나타난 것입니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;전체 지원자 수가 남녀 모두 120명이라는 점은 뒤집힘을 막아 주지 않습니다. 중요한 것은 120명이 난이도가 다른 두 학과에 어떻게 배분되었느냐입니다. 남성 지원자 중 100명은 합격률이 낮은 A학과에 지원했고, 여성 지원자 중 100명은 합격률이 높은 B학과에 지원했습니다.&lt;/p&gt;

&lt;h2 data-ke-size=&quot;size26&quot;&gt;구성 비율과 가중평균은 어떤 역할을 할까요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;남성 전체 합격률에서는 A학과 합격률 20%가 100명분, B학과 합격률 90%가 20명분 반영됩니다. 여성 전체 합격률에서는 A학과 15%가 20명분, B학과 80%가 100명분 반영됩니다. 남녀에게 서로 다른 가중치가 적용된 셈입니다. 합격하기 쉬운 학과에 지원한 비중이 큰 여성의 전체 합격률이 높아진 이유가 여기에 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서 전체 수치는 ‘이 대학에 지원한 남녀 전체가 얻은 결과’를 요약하고, 학과별 수치는 ‘같은 학과에 지원한 남녀의 결과’를 비교합니다. 두 값이 답하는 질문부터 다릅니다. 어느 하나가 거짓인 것이 아니라 분석 단위와 분모의 구성이 다르므로 해석 범위를 구분해야 합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 표만으로 성별이 합격 여부의 원인이라거나 차별이 있었다고 단정할 수도 없습니다. 지원 동기, 전형 방식, 지원 자격, 세부 전공처럼 표에 없는 요인이 남아 있기 때문입니다. 실제 대학 입학 자료에서 집계 결과와 학과별 결과의 차이를 분석한 버클리 연구 역시 학과 선택과 입학 구조를 함께 검토해야 한다는 대표 사례를 제공합니다.&lt;/p&gt;

&lt;h2 data-ke-size=&quot;size26&quot;&gt;실제 통계를 읽을 때 무엇을 점검해야 할까요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;뉴스나 보고서에서 전체 비율 차이를 발견했다면 백분율만 옮겨 적지 말고 분자와 분모를 확인하는 편이 안전합니다. 지역별 건강 지표라면 연령 구성, 병원별 치료 성과라면 환자의 중증도, 학교 평균 점수라면 학년이나 선택 과목 구성이 전체값을 바꿀 수 있습니다. 원자료를 의미 있는 범주로 나누어 각 행의 비율을 다시 계산하고, 같은 자료를 합쳤을 때 비교 방향이 유지되는지 살펴보면 됩니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;방향이 달라졌다면 집단 구성을 가른 변수가 무엇인지 묻습니다. 그 변수가 결과보다 시간적으로 앞서는지, 비교 대상과 결과 양쪽에 관련되는지, 분석 질문에 필요한 조정 변수인지도 따져야 합니다. 이런 검토가 있어야 단순한 숫자 차이를 원인으로 오해하지 않을 수 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다만 자료를 잘게 나눈다고 언제나 더 정확해지는 것은 아닙니다. 결과와 원인의 영향을 함께 받는 변수를 조건으로 삼으면 콜라이더 편향이 생길 수 있고, 분석 대상이 특정 조건을 충족한 사람에게만 제한되면 선택 편향이 커질 수 있습니다. 분류 기준은 뒤집힘을 찾기 위한 장식이 아니라, 조사 설계와 분석 목적에 따라 정해야 할 판단 대상입니다.&lt;/p&gt;

&lt;h2 data-ke-size=&quot;size26&quot;&gt;합격률에서 어떤 결론까지 말할 수 있을까요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;전체 합격률은 조직 전체의 결과를 요약하는 데 유용하고, 학과별 합격률은 같은 학과 안의 집단을 비교하는 데 알맞습니다. 전체 표만 보고 개인의 합격 가능성이나 집단 차이의 원인을 설명해서는 안 되며, 학과별 표만 보고 대학 전체에서 실제로 발생한 결과를 지워서도 곤란합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;심슨의 역설이 주는 교훈은 숫자를 무조건 의심하라는 뜻이 아닙니다. 비율의 분모가 누구로 구성되었는지, 각 하위 집단에 어떤 가중치가 붙었는지, 현재 수치가 정확히 어떤 질문에 답하는지를 함께 읽으라는 뜻에 가깝습니다. 통계는 공식을 외우는 과목이라기보다 생활 속 숫자의 의미와 한계를 판단하는 도구입니다.&lt;/p&gt;

&lt;h2 data-ke-size=&quot;size26&quot;&gt;참고 자료&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;심슨의 역설의 정의와 집계 자료 해석 원칙은 &lt;a href=&quot;https://plato.stanford.edu/entries/paradox-simpson/&quot; rel=&quot;noopener noreferrer&quot;&gt;Stanford Encyclopedia of Philosophy, Simpson’s Paradox&lt;/a&gt;를 참고했습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;대학 입학 자료에서 집계 결과와 학과별 결과가 달라지는 실제 분석 사례는 Bickel, Hammel, O’Connell의 논문 &lt;a href=&quot;https://doi.org/10.1126/science.187.4175.398&quot; rel=&quot;noopener noreferrer&quot;&gt;Sex Bias in Graduate Admissions: Data from Berkeley&lt;/a&gt;에서 확인할 수 있습니다.&lt;/p&gt;</description>
      <category>가중평균</category>
      <category>구성비율</category>
      <category>대학입학</category>
      <category>선택편향</category>
      <category>심슨의역설</category>
      <category>집계자료</category>
      <category>콜라이더편향</category>
      <category>통계해석</category>
      <category>하위집단</category>
      <category>합격률</category>
      <author>그래프 한입</author>
      <guid isPermaLink="true">https://dailyworklog.tistory.com/108</guid>
      <comments>https://dailyworklog.tistory.com/108#entry108comment</comments>
      <pubDate>Sun, 9 Aug 2026 12:20:40 +0900</pubDate>
    </item>
    <item>
      <title>결측치 처리 방법, 빈칸 판단하기</title>
      <link>https://dailyworklog.tistory.com/107</link>
      <description>&lt;h2 data-ke-size=&quot;size26&quot;&gt;빈칸과 0은 왜 다른가&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;조사표나 엑셀 파일에서 빈칸을 발견하면 0을 입력하거나 해당 행을 지우기 쉽습니다. 그러나 0은 실제로 관측된 값이고, 빈칸은 값을 알 수 없다는 표시입니다. 월 지출액 0원은 지출하지 않았다는 뜻이지만 빈칸에는 응답 거부, 기록 누락, 질문 비해당, 장비 오류처럼 서로 다른 사정이 숨어 있을 수 있습니다. 결측치 처리 방법은 계산 편의가 아니라 그 사정과 분석 목적을 기준으로 정해야 합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;자료를 받으면 빈 셀뿐 아니라 ‘모름’, ‘응답 거부’, 하이픈, 999처럼 결측을 대신한 코드도 찾아야 합니다. 프로그램이 999를 정상적인 큰 수로 읽으면 평균이 엉뚱하게 높아질 수 있습니다. 결측 표시는 하나로 통일하되 원래의 누락 사유는 별도 변수로 보존하는 편이 안전합니다. 원자료는 수정하지 않고 복사본에서 처리해야 기준을 바꾸더라도 처음 상태로 돌아갈 수 있습니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;누락은 누구에게 몰려 있는가&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;전체 결측률 하나만으로 삭제 여부를 판단해서는 안 됩니다. 문항별 누락 수를 센 뒤 연령대, 지역, 조사 방식 같은 주요 집단별 결측률을 비교해야 합니다. 결측 여부를 1과 0으로 표시한 변수를 만들고 두 집단의 직업, 소비액, 교육 수준 등 이미 관측된 값이 다른지도 살펴볼 수 있습니다.&lt;/p&gt;
&lt;table style=&quot;width: 100%; border-collapse: collapse; margin: 16px 0;&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;thead&gt;
&lt;tr&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;점검 항목&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;계산하거나 확인할 내용&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;알 수 있는 위험&lt;/th&gt;&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;문항별 결측 수&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;질문마다 빈칸의 수와 비율을 계산합니다.&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;어렵거나 민감한 질문에 누락이 집중됐는지 파악할 수 있습니다.&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;집단별 결측률&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;연령대·지역·조사 방식별 누락 비율을 비교합니다.&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;특정 집단이 분석에서 과소 대표될 가능성을 확인할 수 있습니다.&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;결측 여부별 관측값&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;응답자와 미응답자의 직업·소비액 등 남아 있는 값을 비교합니다.&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;완전 응답자만으로 전체를 설명하기 어려운지 판단할 수 있습니다.&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;누락 사유&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;응답 거부·비해당·입력 오류·측정 실패를 가능한 범위에서 구분합니다.&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;삭제, 대체, 별도 범주 가운데 타당한 방식을 고를 근거가 생깁니다.&lt;/td&gt;&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;통계학에서는 누락이 다른 관측값이나 누락된 값 자체와 어떤 관계를 갖는지에 따라 결측 메커니즘을 구분합니다. 관측된 변수에서 두 집단이 비슷해 보여도 누락 원인이 정작 비어 있는 결과값과 관련될 수 있습니다. 따라서 결측률이 낮거나 눈에 띄는 집단 차이가 없다는 사실만으로 행 삭제를 정당화할 수 없습니다. 어떤 가정 아래 삭제했는지 밝히고 처리 방식을 바꿔도 결론이 유지되는지 민감도 분석을 병행해야 합니다. 이 구분과 주의점은 결측자료 분석의 표준 교재인 Little과 Rubin의 &lt;em&gt;Statistical Analysis with Missing Data&lt;/em&gt;에서 체계적으로 설명됩니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;행을 삭제하면 표본은 어떻게 달라지는가&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;가상의 소득 조사표에 20대, 40대, 60대가 각각 40명씩 참여했다고 가정해 보겠습니다. 소득을 밝히지 않은 사람이 20대 2명, 40대 6명, 60대 18명이라면 전체 120명 가운데 결측은 26명입니다. 소득이 적힌 행만 남기는 순간 연령별 인원은 38명, 34명, 22명으로 바뀝니다.&lt;/p&gt;
&lt;table style=&quot;width: 100%; border-collapse: collapse; margin: 16px 0;&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;thead&gt;
&lt;tr&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;연령대&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;조사 참여자&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;소득 미응답자&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;삭제 후 남은 사람&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;삭제 후 표본 비중&lt;/th&gt;&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;20대&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;40명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;2명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;38명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;40.4%&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;40대&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;40명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;6명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;34명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;36.2%&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;60대&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;40명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;18명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;22명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;23.4%&lt;/td&gt;&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;조사 당시에는 세 연령대가 각각 33.3%였지만, 삭제 후 60대 비중은 23.4%로 줄었습니다. 행 삭제를 검토할 때는 삭제 전후의 연령 구성표를 나란히 놓아야 이런 변화를 바로 볼 수 있습니다. 이때 계산한 전체 평균소득은 처음 조사한 120명의 평균이 아니라 ‘소득에 응답한 94명의 평균’입니다. 연령과 소득 수준이 관련돼 있다면 표본 구성 변화가 평균의 방향까지 바꿀 수 있습니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;삭제와 대체는 무엇을 기준으로 고르는가&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;분석에 쓰지 않는 변수에만 빈칸이 있다면 해당 변수를 제외하고 나머지 응답은 활용할 수 있습니다. 필요한 변수의 결측 사례를 삭제하려면 누락 원인, 집단별 편중, 삭제 전후 표본 구성, 분석 목적을 함께 검토해야 합니다. 연락처 누락, 민감한 소득 질문의 응답 거부, 장비 고장으로 생긴 측정 실패를 같은 규칙으로 처리할 이유는 없습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;평균이나 중앙값을 넣는 단순 대체는 표본 수를 유지하지만 실제로 관측하지 않은 사람들에게 비슷한 값을 부여합니다. 그 결과 값의 다양성이 줄고 분산, 상관관계, 표준오차가 왜곡될 수 있습니다. 미국 국립연구위원회의 &lt;em&gt;The Prevention and Treatment of Missing Data in Clinical Trials&lt;/em&gt;도 단일한 값으로 채우는 방식이 결측으로 인한 불확실성을 충분히 반영하지 못한다고 지적합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;회귀 예측이나 다중대체는 관측된 여러 정보를 활용한다는 장점이 있지만 자동으로 정답을 만들어 주지는 않습니다. 특히 다중대체는 빈칸마다 여러 개의 가능한 값을 생성하고 각각의 분석 결과를 결합해 대체 과정의 불확실성을 반영하는 방법입니다. 사용할 변수, 결측 메커니즘에 관한 가정, 생성한 자료의 수와 결합 절차를 공개할 수 있을 때 선택해야 합니다. 단순 대체와 다중대체의 차이 역시 Little과 Rubin의 교재에서 상세히 다룹니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;결과를 공개할 때 무엇을 남겨야 하는가&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;작업 기록에는 원자료 보존 여부, 결측으로 인정한 코드, 문항별 결측 수와 비율, 집단별 편중, 제외 또는 대체 조건을 남겨야 합니다. 완전 응답만 사용한 결과와 합리적인 다른 처리 결과를 함께 계산해 방향과 크기가 유지되는지도 확인할 필요가 있습니다. 결론이 크게 달라지면 어느 수치 하나를 확정적으로 제시하기보다 결측 처리에 민감한 결과라고 설명하는 편이 정확합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;빈칸은 지워야 할 잡음이 아니라 자료가 어디까지 말할 수 있는지를 알려 주는 표시입니다. 좋은 분석은 빈칸을 감추지 않습니다. 누가 빠졌고, 그 누락이 표본과 결론을 얼마나 바꾸는지 독자가 판단할 수 있도록 드러냅니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;참고 문헌&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Little, R. J. A. &amp;amp; Rubin, D. B. (2019), &lt;em&gt;Statistical Analysis with Missing Data&lt;/em&gt;, 3rd Edition, Wiley.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;National Research Council (2010), &lt;em&gt;The Prevention and Treatment of Missing Data in Clinical Trials&lt;/em&gt;, National Academies Press.&lt;/p&gt;</description>
      <category>결측률</category>
      <category>결측메커니즘</category>
      <category>결측치</category>
      <category>다중대체</category>
      <category>단순대체</category>
      <category>데이터분석</category>
      <category>민감도분석</category>
      <category>원자료보존</category>
      <category>표본편향</category>
      <category>행삭제</category>
      <author>그래프 한입</author>
      <guid isPermaLink="true">https://dailyworklog.tistory.com/107</guid>
      <comments>https://dailyworklog.tistory.com/107#entry107comment</comments>
      <pubDate>Sat, 8 Aug 2026 20:40:01 +0900</pubDate>
    </item>
    <item>
      <title>설문 문항 편향, 유도 질문 고치기</title>
      <link>https://dailyworklog.tistory.com/106</link>
      <description>&lt;h2 data-ke-size=&quot;size26&quot;&gt;설문 결과는 질문을 통과해 만들어집니다&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;설문 결과가 달라지면 연령이나 지역 같은 응답자 구성부터 의심하기 쉽습니다. 그러나 같은 사람에게 물어도 질문에 평가가 섞이거나 선택지의 범위와 순서가 달라지면 응답 비율은 움직입니다. 이는 사람을 잘못 뽑은 표본 오류와 구별되는 측정 단계의 오류입니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;유도 질문은 특정 답을 상식적이거나 바람직하게 보이게 합니다. “낭비를 줄이기 위해 계획적으로 소비하고 있습니까?”라는 문장에는 절약이 옳다는 평가가 들어 있습니다. 응답자는 실제 행동보다 책임감 있는 사람으로 보이는 답을 고를 수 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;숨은 전제도 문제입니다. “늘어난 충동구매를 줄이기 위해 무엇을 합니까?”는 충동구매가 실제로 늘었다고 가정합니다. 변화가 없거나 줄어든 사람에게 맞는 답이 없다면 결과는 행동보다 문항의 가정을 반영하게 됩니다. “자주”, “합리적”, “과소비”처럼 기준이 사람마다 다른 말도 기간과 관찰 가능한 행동으로 바꾸는 편이 낫습니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;유도 질문을 중립형 문항으로 고치는 기준&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;문항을 고치기 전에는 측정 대상을 한 문장으로 정리합니다. 확인할 내용이 ‘최근 한 달간 계획하지 않은 물건을 산 횟수’라면 절약 의지나 소비 태도를 함께 물을 이유가 없습니다. 한 문항에는 하나의 행동을 담고, 회상 기간과 판단 기준을 분명히 제시해야 합니다.&lt;/p&gt;
&lt;table style=&quot;width: 100%; border-collapse: collapse; margin: 16px 0;&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;thead&gt;
&lt;tr&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;문제 유형&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;수정 전 문항&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;수정 후 문항&lt;/th&gt;&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;바람직한 답 암시&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;현명한 소비자라면 구매 전에 가격을 비교해야 한다고 생각합니까?&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;최근 30일 동안 물건을 사기 전 두 곳 이상의 가격을 비교한 적이 있습니까?&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;사실을 미리 가정&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;늘어난 충동구매를 줄이기 위해 어떤 노력을 하고 있습니까?&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;최근 30일 동안 계획하지 않았던 물건을 구매한 횟수는 몇 회입니까?&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;두 행동을 함께 질문&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;예산을 세우고 지출 내역도 기록합니까?&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;다음 달에 쓸 예산을 미리 정합니까?&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;모호한 빈도 표현&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;온라인 쇼핑을 자주 이용합니까?&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;최근 30일 동안 온라인 쇼핑으로 결제한 날은 며칠입니까?&lt;/td&gt;&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;수정 후 문항은 성격이나 태도를 평가하기보다 기억할 수 있는 행동을 묻습니다. 다만 구체적인 질문도 완벽하지는 않습니다. 결제 기록을 확인했는지 기억에 의존했는지에 따라 정확도가 달라지고, ‘계획하지 않은 구매’의 기준 역시 응답자마다 조금씩 다를 수 있습니다. 통계는 문항을 다듬어 오류 경로를 줄일 수 있지만 측정의 한계까지 없애 주지는 않습니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;선택지의 범위와 순서도 응답을 바꿉니다&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;질문이 중립적이어도 선택지가 실제 상황을 담지 못하면 결과가 한쪽으로 몰립니다. 월간 충동구매 횟수를 ‘없음, 1회, 2회, 3회 이상’으로 나누면 구매가 잦은 사람들의 차이가 모두 마지막 구간에 묶입니다. 반대로 지나치게 잘게 나누면 정확히 기억하지 못하는 응답자에게 추측을 요구합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;범주끼리는 겹치지 않아야 합니다. 연령을 ‘20세 이하, 20~29세, 30~39세’로 제시하면 20세가 두 곳에 포함됩니다. ‘19세 이하, 20~29세, 30~39세’처럼 경계를 바로잡아야 합니다. 필요한 문항에는 ‘해당 없음’, ‘모르겠음’, ‘답변하고 싶지 않음’을 두어 억지 선택을 줄입니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;고정된 배열에서 앞쪽 항목이 더 쉽게 선택되는 순서 효과도 살펴야 합니다. 브랜드나 정책 목록은 가능하면 응답자마다 순서를 무작위로 바꿉니다. 무작위 배열이 어렵다면 순서가 다른 두 설문지를 소수에게 배포해 분포가 달라지는지 확인할 수 있습니다. 미국여론조사협회는 질문 표현과 순서, 응답 선택지가 측정에 미치는 영향을 설계 단계에서 검토하도록 안내합니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;같은 소비 습관을 두 문장으로 물어보는 장면&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;가상 설문지를 절반씩 나눠 배포한다고 가정해 보겠습니다. A안은 “불필요한 지출을 막기 위해 장바구니 상품을 신중하게 검토합니까?”라고 묻습니다. B안은 “최근 30일 동안 온라인 장바구니에 담은 뒤 구매하지 않은 상품이 있었습니까?”라고 묻습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;A안에는 ‘불필요한 지출을 막는다’와 ‘신중하다’는 긍정적 평가가 들어 있어 ‘그렇다’가 더 많아질 가능성이 있습니다. B안은 기간과 행동이 구체적이지만 구매하지 않은 이유가 절약인지, 품절인지, 단순 변심인지는 알 수 없습니다. 따라서 B안의 ‘있다’를 신중한 소비 태도의 증거로 단정해서는 안 됩니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;두 문항의 차이를 보려면 응답자를 임의로 나누고 질문 외의 배포 조건을 같게 해야 합니다. 차이가 나타났을 때도 응답자 수와 배정 방식, 우연한 변동을 함께 검토합니다. 이 장면의 목적은 예상 비율을 만들어 내는 것이 아니라 문장 하나가 무엇을 더 측정하고 무엇을 놓치는지 확인하는 데 있습니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;배포 전 점검은 짧고 구체적으로&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1단계에서는 평가어, 숨은 전제, 한 문장에 묶인 두 질문을 표시합니다. 2단계에서는 기간과 행동 기준을 넣고 선택지의 중복과 빈틈을 확인합니다. 3단계에서는 실제 조사 대상과 비슷한 소수에게 문항을 읽힌 뒤 “어떤 뜻으로 이해했습니까?”라고 묻습니다. 응답자가 자기 말로 질문을 설명하고 답을 고른 이유를 말하게 하는 인지 면담입니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;인지 면담에서는 정답을 알려주지 않습니다. 어떤 단어에서 멈췄는지, 떠올린 기간은 언제부터인지, 맞는 선택지가 없었는지를 기록합니다. 미국 질병통제예방센터의 설문 문항 평가 자료도 이런 인지 면담을 통해 질문의 이해·회상·판단·응답 과정을 점검하는 근거를 제공합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;결과를 공개할 때는 응답 비율만 떼어 놓지 말고 문항 원문, 선택지, 조사 방식도 함께 제시해야 합니다. 설문 숫자는 생각을 그대로 꺼낸 값이 아니라 질문과 선택지, 조사 환경을 거쳐 만들어진 값입니다. 잘 고친 문항은 편향을 완전히 제거하지는 못해도 숫자가 의미하는 범위와 해석의 책임을 훨씬 선명하게 만듭니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;참고한 설문 설계 자료&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://aapor.org/standards-and-ethics/best-practices/&quot; rel=&quot;noopener noreferrer&quot;&gt;미국여론조사협회(AAPOR), Best Practices for Survey Research&lt;/a&gt; — 질문 표현, 문항 순서, 응답 선택지와 조사 결과 공개 원칙을 확인할 수 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://wwwn.cdc.gov/qbank/Home.aspx&quot; rel=&quot;noopener noreferrer&quot;&gt;미국 질병통제예방센터(CDC), Q-Bank&lt;/a&gt; — 인지 면담을 포함한 설문 문항 평가 자료와 문항별 검토 사례를 제공합니다.&lt;/p&gt;</description>
      <category>문항편향</category>
      <category>사전검토</category>
      <category>선택지설계</category>
      <category>설문조사</category>
      <category>순서효과</category>
      <category>유도질문</category>
      <category>응답분석</category>
      <category>인지면담</category>
      <category>질문설계</category>
      <category>측정오류</category>
      <author>그래프 한입</author>
      <guid isPermaLink="true">https://dailyworklog.tistory.com/106</guid>
      <comments>https://dailyworklog.tistory.com/106#entry106comment</comments>
      <pubDate>Sat, 8 Aug 2026 12:10:16 +0900</pubDate>
    </item>
    <item>
      <title>무작위 표본 추출, 설문 대상 뽑기</title>
      <link>https://dailyworklog.tistory.com/105</link>
      <description>&lt;h2 data-ke-size=&quot;size26&quot;&gt;무작위로 뽑는다는 말은 무엇일까요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;설문 결과를 읽을 때 응답자 수만큼 중요한 질문은 ‘누가 어떤 절차로 조사 대상이 되었는가’입니다. 많은 사람에게 물었더라도 조사원이 만나기 쉬운 사람만 골랐다면 모집단 전체의 생각을 반영하기 어렵습니다. 반대로 대상별 선택 기회를 분명히 하고 정해진 규칙으로 뽑았다면, 표본에서 모집단을 추론할 근거가 생깁니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;단순무작위추출은 모집단의 각 대상이 표본으로 선택될 확률이 같도록 설계하는 확률표본추출입니다. 조사자의 판단이나 접근 편의가 선정 여부를 좌우해서는 안 됩니다. 사람을 아무렇게나 고르는 일상어의 ‘임의 선택’과 통계에서 말하는 ‘무작위’가 다른 이유입니다. 캐나다 통계청의 &lt;a href=&quot;https://www150.statcan.gc.ca/n1/edu/power-pouvoir/ch13/prob/5214899-eng.htm&quot; target=&quot;_blank&quot; rel=&quot;noopener noreferrer&quot;&gt;확률표본추출 안내&lt;/a&gt;도 단순무작위추출에서는 모집단의 각 단위가 동일한 선택 기회를 갖는다고 설명합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 조건을 지키려면 조사 범위와 기준일을 정하고, 전체 대상이 들어 있는 표본틀을 만든 뒤 고유 번호를 붙여야 합니다. 이어 난수 생성 범위와 표본 수, 중복 허용 여부를 조사 전에 확정합니다. 추첨 결과가 마음에 들지 않는다는 이유로 다시 뽑거나 특정 대상을 끼워 넣으면 처음의 선택확률은 유지되지 않습니다.&lt;/p&gt;

&lt;h2 data-ke-size=&quot;size26&quot;&gt;아파트 120가구에서는 어떻게 추출할까요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;3개 동에 동마다 10개 층, 층별 4가구가 있는 가상 아파트를 생각해 보겠습니다. 조사 기준일 현재 입주한 120가구가 모집단입니다. 101동 1층의 첫 가구부터 일정한 순서로 1번에서 120번까지 번호를 부여하고, 이 가운데 12가구를 중복 없이 뽑습니다.&lt;/p&gt;
&lt;table style=&quot;width: 100%; border-collapse: collapse; margin: 16px 0;&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;thead&gt;
&lt;tr&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;추출 단계&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;120가구 설문에서 할 일&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;잘못되기 쉬운 부분&lt;/th&gt;&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;모집단 확정&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;기준일 현재 입주한 가구만 조사 대상으로 정합니다.&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;빈집이나 상가를 가구로 포함할 수 있습니다.&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;표본틀 작성&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;동·층·호수를 대조해 1~120의 고유 번호를 붙입니다.&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;전입 가구 누락이나 번호 중복이 생길 수 있습니다.&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;난수 추출&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;1~120에서 서로 다른 번호 12개를 한 번 뽑습니다.&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;선정 결과를 보고 다시 추첨할 수 있습니다.&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;조사 요청&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;선정된 모든 가구에 같은 연락 원칙을 적용합니다.&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;부재 가구를 옆집으로 바꿀 수 있습니다.&lt;/td&gt;&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;실행 장면을 구체적으로 보면 절차의 의미가 선명해집니다. 관리 명부의 동·층·호수 옆에 번호를 적고, 난수로 나온 7번·18번·43번 같은 번호에 표시한 뒤 실제 주소와 맞춰 봅니다. 이때 조사원이 평일 낮에 방문하기 편한 저층 가구를 추가할 여지는 없습니다. 누가 뽑힐지는 목록과 난수가 결정합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다만 난수 버튼이 부정확한 목록을 고쳐 주지는 않습니다. 명부에서 15가구가 빠졌다면 그 가구의 선택확률은 같은 것이 아니라 0입니다. 이런 표본틀의 누락은 포함오차에 해당하며, 추출이 무작위였다는 사실만으로 해결되지 않습니다. 조사 기준일의 실제 입주 현황과 명부를 대조해야 하는 까닭입니다.&lt;/p&gt;

&lt;h2 data-ke-size=&quot;size26&quot;&gt;편한 가구를 고르는 방식과 무엇이 다를까요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;조사원이 평일 낮에 문을 열어 주는 가구만 방문하면 재택 시간이 긴 주민이 표본에 들어오기 쉽습니다. 출근하거나 외출한 주민은 사실상 선택되기 어렵습니다. 1층이나 관리사무소 주변부터 조사한다면 층과 동에 따른 생활 조건도 한쪽으로 기울 수 있습니다. 표본 수를 늘려도 이러한 선택 구조에서 생긴 편향은 저절로 사라지지 않습니다.&lt;/p&gt;
&lt;table style=&quot;width: 100%; border-collapse: collapse; margin: 16px 0;&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;thead&gt;
&lt;tr&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;대상 선정 방식&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;가구를 정하는 기준&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;결과를 해석할 수 있는 범위&lt;/th&gt;&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;단순무작위추출&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;완성된 명부에서 각 가구가 같은 확률로 뽑히게 합니다.&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;표본틀과 무응답의 한계를 밝힌다면 모집단 추론의 근거가 됩니다.&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;편의표본추출&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;조사 시점에 만나기 쉽거나 참여 의사가 강한 가구를 고릅니다.&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;응답한 집단의 경향은 보여도 전체 주민으로 일반화하기 어렵습니다.&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;조사자의 자의적 선택&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;대표적으로 보인다는 판단에 따라 가구를 고릅니다.&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;선택확률을 알 수 없어 표본오차를 확률적으로 계산하기 어렵습니다.&lt;/td&gt;&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;일부 가구를 편의대로 고른 다음 그 안에서 제비를 뽑는 방식도 전체 모집단에 대한 단순무작위추출이 아닙니다. 처음 제외된 가구에는 선택 기회가 없기 때문입니다. 보고서의 ‘무작위 조사’라는 표현만 보지 말고, 무작위화가 전체 명부에서 시작됐는지 확인해야 합니다.&lt;/p&gt;

&lt;h2 data-ke-size=&quot;size26&quot;&gt;선정 가구가 응답하지 않으면 어떻게 처리할까요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;잘 뽑은 표본도 응답 거절이나 부재를 만나면 구성이 달라질 수 있습니다. 응답하지 않은 가구의 생활 방식이나 의견이 응답 가구와 체계적으로 다르면 무응답 편향이 생깁니다. 이때 옆집이나 조사원이 만나기 쉬운 가구로 즉시 바꾸면 원래의 확률표본 설계가 훼손됩니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;연락 횟수와 시간대, 접촉 중단 기준은 사전에 정하고 모든 선정 가구에 같은 방식으로 적용해야 합니다. 예비 가구를 두더라도 본표본과 같은 추출 절차로 순서를 정했다는 사실만으로 대체가 자동으로 정당화되지는 않습니다. 대체 조건을 미리 명시하고, 실제 대체 내역을 기록하며, 분석 단계에서 원래의 선택확률과 무응답 조정이 어떻게 반영되는지까지 설계해야 합니다. 무응답이 조사 품질에 미치는 영향과 가중치 조정의 필요성은 미국 인구조사국의 &lt;a href=&quot;https://www.census.gov/programs-surveys/acs/methodology/design-and-methodology.html&quot; target=&quot;_blank&quot; rel=&quot;noopener noreferrer&quot;&gt;조사 설계 및 방법론 자료&lt;/a&gt;에서도 확인할 수 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;결과를 공개할 때는 최초 선정 가구 수, 접촉 성공 가구 수, 거절·부재 건수, 최종 응답 가구 수를 구분하는 편이 좋습니다. 응답률 하나만으로 편향의 크기를 확정할 수는 없지만, 누가 조사 과정에서 빠졌는지 판단할 최소한의 단서는 됩니다.&lt;/p&gt;

&lt;h2 data-ke-size=&quot;size26&quot;&gt;설문 보고서에서는 무엇을 확인해야 할까요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;보고서에서 모집단의 정의, 표본틀의 출처와 기준일, 난수 추출 방법, 표본 규모, 조사 기간, 접촉 규칙, 무응답 및 대체 처리 방식을 함께 살펴야 합니다. 특정 동이나 연령대처럼 중요한 집단의 수가 지나치게 적을 가능성이 크다면 단순무작위추출보다 집단별로 나누어 뽑는 층화추출이 조사 목적에 더 알맞을 수도 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;확률표본은 표본오차를 계산할 기반을 제공하지만 대표성을 자동으로 보장하지는 않습니다. 명부 누락, 질문 문구, 조사 시간대, 무응답 같은 비표본오차가 남기 때문입니다. 통계는 공식을 외우는 데서 끝나지 않습니다. 설문 속 숫자가 누구의 답을 담았고 누구를 놓쳤는지 따져, 그 숫자의 의미와 한계를 판단하는 도구입니다.&lt;/p&gt;</description>
      <category>난수추출</category>
      <category>단순무작위추출</category>
      <category>모집단</category>
      <category>무응답편향</category>
      <category>선택편향</category>
      <category>설문조사</category>
      <category>편의표본추출</category>
      <category>표본오차</category>
      <category>표본틀</category>
      <category>확률표본추출</category>
      <author>그래프 한입</author>
      <guid isPermaLink="true">https://dailyworklog.tistory.com/105</guid>
      <comments>https://dailyworklog.tistory.com/105#entry105comment</comments>
      <pubDate>Sat, 8 Aug 2026 03:00:39 +0900</pubDate>
    </item>
    <item>
      <title>이동평균 계산 방법, 방문 추세 찾기</title>
      <link>https://dailyworklog.tistory.com/104</link>
      <description>&lt;h2 data-ke-size=&quot;size26&quot;&gt;이동평균은 왜 필요한가요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;카페 방문객 수처럼 하루 단위로 크게 출렁이는 자료에서는 숫자가 올랐다는 사실과 실제 추세가 좋아졌다는 판단을 구분해야 합니다. 비, 주말, 단체 예약, 주변 행사 같은 일시적인 요인이 하루 수치를 크게 흔들 수 있기 때문입니다. 이동평균은 일정한 길이의 연속 구간을 정하고 그 안의 값을 평균 내어, 짧은 기간의 우연한 등락을 완화하는 방법입니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;3일 이동평균이라면 연속된 3일의 값을 더해 3으로 나눕니다. 다음 값을 구할 때는 가장 오래된 하루를 제외하고 새로운 하루를 포함하므로 계산 구간이 날짜를 따라 한 칸씩 움직입니다. 미국 국립표준기술연구소의 통계 공학 안내서도 이동평균을 시계열의 불규칙한 변동을 평활화하는 방법으로 설명합니다. 핵심은 수치를 매끈하게 만드는 데 있지 않고, 원자료에서 반복되는 흐름을 더 쉽게 읽는 데 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다만 이동평균선은 원자료를 대체하지 않습니다. 평균 과정에서 하루의 급등과 급락이 주변 날짜에 나뉘어 반영되므로, 날씨나 행사처럼 변동을 일으킨 배경 정보까지 함께 살펴야 숫자의 의미를 놓치지 않습니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;가상 카페의 3일 이동평균은 어떻게 계산하나요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;날씨에 따라 방문객이 크게 달라지는 가상 카페의 7일 자료를 날짜별 행으로 놓고, 날씨와 상황·방문객 수·해당 날짜까지의 3일 평균을 서로 다른 열로 비교했습니다. 여기서는 과거 2일과 당일을 묶고 평균값을 구간의 마지막 날에 표시하는 후행 방식을 사용합니다.&lt;/p&gt;
&lt;table style=&quot;width: 100%; border-collapse: collapse; margin: 16px 0;&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;thead&gt;
&lt;tr&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;요일&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;날씨와 영업 상황&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;방문객 수&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;3일 후행 이동평균&lt;/th&gt;&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;월요일&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;흐림&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;80명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;자료 부족&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;화요일&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;비&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;50명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;자료 부족&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;수요일&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;맑음&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;95명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;75.0명&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;목요일&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;맑음&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;105명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;83.3명&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;금요일&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;맑음·주변 행사&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;140명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;113.3명&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;토요일&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;비&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;90명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;111.7명&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;일요일&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;흐림&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;100명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;110.0명&lt;/td&gt;&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;수요일 값은 (80+50+95)÷3=75.0명입니다. 목요일에는 월요일을 빼고 목요일을 넣어 (50+95+105)÷3=83.3명으로 계산합니다. 금요일도 같은 규칙을 적용하면 (95+105+140)÷3=113.3명입니다. 이동평균 계산 방법의 요점은 매번 새 공식을 만드는 것이 아니라, 동일한 길이와 동일한 날짜 표시 기준을 끝까지 유지하는 데 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;원자료에서는 비가 온 화요일의 50명과 행사가 있었던 금요일의 140명이 강하게 눈에 들어옵니다. 반면 이동평균은 수요일 75.0명에서 금요일 113.3명까지 올라간 뒤 주말에는 110명 안팎을 유지합니다. 이 결과만으로 장기 성장을 확정할 수는 없지만, 최근 며칠의 평균 수준이 주 초반보다 높아졌다고는 말할 수 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;특히 토요일은 전날보다 방문객이 50명 줄었는데도 이동평균이 111.7명입니다. 목요일과 금요일의 큰 값이 계산 구간에 남아 있기 때문입니다. 이 장면은 당일 실적의 하락과 최근 3일 수준의 상승이 동시에 성립할 수 있음을 보여 줍니다. 원자료와 평균선을 함께 봐야 하는 이유도 여기에 있습니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;후행 이동평균은 왜 변화보다 늦게 움직이나요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;후행 이동평균은 오늘 값만 반영하지 않고 앞선 날짜의 값도 함께 사용합니다. 새로운 급등이나 급락이 발생해도 이전 수치가 계산 구간에서 빠져나갈 때까지 영향이 남습니다. 따라서 평균선이 실제 변화보다 늦게 방향을 바꾸는 후행성이 생깁니다. 펜실베이니아주립대학교의 시계열 교육 자료에서도 이동평균을 평활화 방법으로 다루며, 구간 길이에 따라 반응성과 평활 정도가 달라진다는 점을 확인할 수 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;평균값을 어느 날짜에 놓았는지도 밝혀야 합니다. 후행 3일 평균은 과거 2일과 당일을 묶어 마지막 날에 표시하므로 매일 운영 현황을 갱신하기 편합니다. 중심 3일 평균은 전날·당일·다음 날을 평균 내어 가운데 날에 표시합니다. 시점은 자연스럽지만 다음 날 자료가 필요해 실시간 점검에는 적합하지 않습니다. 두 방식을 한 그래프에서 설명 없이 섞으면 변화가 시작된 날짜를 잘못 읽을 수 있습니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;3일과 7일 중 어느 기간을 선택해야 하나요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기간이 짧으면 새 변화에 빠르게 반응하지만 우연한 등락이 충분히 줄지 않을 수 있습니다. 기간을 길게 잡으면 선은 더 부드러워지는 대신 상승과 하락을 늦게 보여 줍니다. 가장 매끈한 선이 언제나 좋은 것은 아닙니다. 분석하려는 시간 범위와 자료의 반복 주기에 맞춰 기간을 선택해야 합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;매일 집계한 방문 자료에서 요일 효과가 크다면 7일 이동평균은 한 주 단위의 수준을 비교하는 데 도움이 됩니다. 단기 행사나 날씨 변화에 대한 반응을 보려면 3일 평균이 더 빠르게 움직입니다. 실무적으로는 3일과 7일 결과를 함께 계산한 뒤, 중요한 전환점이 각각 며칠 늦게 나타나는지 확인하는 편이 안전합니다. 기간 선택 자체가 분석자의 판단이라는 사실도 기록해 두어야 합니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;결측값과 특별한 날은 어떻게 다뤄야 하나요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;3일 후행 평균은 셋째 날부터, 7일 후행 평균은 일곱째 날부터 계산할 수 있습니다. 앞부분의 빈칸은 방문객이 0명이었다는 뜻이 아니라 계산에 필요한 관측일이 부족하다는 뜻입니다. 이를 0으로 채우면 관측되지 않은 날을 실제 영업했지만 손님이 없었던 날로 바꾸게 되어 평균이 낮아집니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;중간 날짜의 값이 누락된 경우에도 임의로 0을 넣지 않아야 합니다. 휴점, 집계 오류, 기록 누락 가운데 어떤 사유인지 확인하고 처리 규칙을 남겨야 합니다. 세 날짜 중 두 날짜만 평균 낼지, 해당 구간 전체를 결측으로 둘지에 따라 결과가 달라지므로 비교 대상에는 같은 규칙을 적용해야 합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;날씨와 행사는 결측값이 아니라 실제 변동의 배경입니다. 금요일의 140명을 이상하다는 이유만으로 삭제하면 주변 행사가 방문에 미친 효과까지 지울 수 있습니다. 원자료 옆에 비, 휴일, 행사, 영업시간 변경을 기록하고 평균선과 함께 읽는 편이 타당합니다. 계산 기간, 후행 또는 중심 여부, 결측 처리 기준을 적어 두면 다른 사람도 같은 결과를 재현할 수 있습니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;방문 추세는 어떤 순서로 판단해야 하나요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;날짜순 원자료를 확인한 뒤 날씨와 행사 정보를 붙이고, 정한 기간과 표시 기준으로 이동평균을 계산합니다. 그 결과를 원자료와 나란히 보면서 평균선의 방향, 당일 값과 평균의 차이, 변동이 컸던 날의 사유를 함께 점검합니다. 평균이 며칠 연속 상승했더라도 영업 조건이 달라졌다면 같은 기준의 비교인지 다시 살펴야 합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;하루의 급등은 중요한 사건일 수 있지만 지속적인 성장의 충분한 증거는 아닙니다. 반대로 하루의 하락만으로 추세가 꺾였다고 단정하기도 어렵습니다. 이동평균은 미래를 보장하는 예측 공식이 아니라, 생활 속 숫자의 우연한 흔들림과 최근 수준을 구분하도록 돕는 요약 도구입니다. 판단은 평균선 하나가 아니라 원자료, 계산 기준, 운영 상황을 함께 검토할 때 비로소 설득력을 갖습니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;참고한 교육 자료&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 글의 이동평균 정의와 평활화 설명은 미국 국립표준기술연구소의 &lt;a href=&quot;https://www.itl.nist.gov/div898/handbook/pmc/section4/pmc422.htm&quot; rel=&quot;noopener noreferrer&quot;&gt;NIST/SEMATECH e-Handbook of Statistical Methods: Moving Average Smoothing&lt;/a&gt;, 기간과 시점 해석은 펜실베이니아주립대학교의 &lt;a href=&quot;https://online.stat.psu.edu/stat510/lesson/5/5.1&quot; rel=&quot;noopener noreferrer&quot;&gt;STAT 510: Smoothing Time Series&lt;/a&gt;를 참고했습니다. 결측값 부분은 관측되지 않은 값과 실제 0을 구분해야 한다는 통계 자료 처리의 기본 원칙을 사례에 적용해 설명했습니다.&lt;/p&gt;</description>
      <category>결측값처리</category>
      <category>기간선택</category>
      <category>데이터해석</category>
      <category>방문객수</category>
      <category>방문추세</category>
      <category>시계열분석</category>
      <category>요일효과</category>
      <category>이동평균</category>
      <category>평활화</category>
      <category>후행평균</category>
      <author>그래프 한입</author>
      <guid isPermaLink="true">https://dailyworklog.tistory.com/104</guid>
      <comments>https://dailyworklog.tistory.com/104#entry104comment</comments>
      <pubDate>Thu, 6 Aug 2026 21:10:03 +0900</pubDate>
    </item>
    <item>
      <title>전년 동기 대비 뜻, 매출 흐름 읽기</title>
      <link>https://dailyworklog.tistory.com/103</link>
      <description>&lt;h2 data-ke-size=&quot;size26&quot;&gt;전년 동기 대비는 어느 시점과 비교할까요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;전년 동기 대비는 현재 실적을 1년 전의 같은 기간과 비교한 비율입니다. 올해 2분기 매출이라면 지난해 2분기가 기준이고, 올해 7월 자료라면 지난해 7월과 비교합니다. 경제 기사와 기업 실적 자료에서는 보통 YoY(Year over Year)로 표시합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;계산은 ‘현재 값에서 전년 같은 기간의 값을 뺀 금액’을 ‘전년 같은 기간의 값’으로 나눈 뒤 100을 곱하는 방식입니다. 지난해 2분기 매출이 112억 원이고 올해 2분기가 138억 원이라면 차이는 26억 원입니다. 이를 기준값인 112억 원으로 나누면 약 23.2%가 됩니다. 여기서 분모는 언제나 비교 기준이 되는 과거 값이라는 점이 중요합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;같은 계절을 비교한다는 데 이 지표의 실용성이 있습니다. 여름에 판매가 몰리는 냉방용품이나 명절에 매출이 뛰는 유통업은 바로 앞 분기와 비교할 때 계절의 영향이 크게 섞일 수 있습니다. 전년의 같은 달이나 같은 분기를 기준으로 삼으면 반복되는 계절 차이를 어느 정도 줄여 연간 흐름을 살필 수 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다만 전년 동기 대비가 계절성을 완전히 제거하는 것은 아닙니다. 명절 날짜, 영업일 수, 날씨처럼 해마다 달라지는 조건이 남을 수 있고, 전년 실적이 일시적으로 낮거나 높았다면 기저효과도 생깁니다. 따라서 높은 증가율을 곧바로 현재 실적이 매우 좋다는 뜻으로 받아들이기보다 기준 시점에 특별한 사건이 없었는지 함께 확인해야 합니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;전기 대비와 전년 동기 대비는 무엇이 다를까요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;전기 대비는 현재 기간을 바로 앞 기간과 비교합니다. 분기 자료에서는 이번 분기와 직전 분기, 월별 자료에서는 이번 달과 전달을 비교합니다. 분기 기준 표기는 QoQ(Quarter over Quarter), 월 기준 표기는 MoM(Month over Month)입니다. 최근 매출의 방향과 변화 속도를 빠르게 파악하는 데 알맞습니다.&lt;/p&gt;
&lt;table style=&quot;width: 100%; border-collapse: collapse; margin: 16px 0;&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;thead&gt;
&lt;tr&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;비교 지표&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;분기 자료의 기준 시점&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;주로 보여주는 흐름&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;해석할 때 살필 조건&lt;/th&gt;&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;전기 대비&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;현재 분기와 직전 분기&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;최근 상승·하락과 단기 변화 속도&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;명절, 휴가철, 영업일 수 등 계절 요인&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;전년 동기 대비&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;현재 분기와 전년의 같은 분기&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;같은 계절을 기준으로 본 연간 성장 흐름&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;전년 기준값의 이상 변동과 기저효과&lt;/td&gt;&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;두 수치는 서로 경쟁하는 지표가 아니라 질문이 다릅니다. 전기 대비는 “최근 한 기간 동안 방향이 어떻게 바뀌었는가”에 답하고, 전년 동기 대비는 “1년 전 같은 시기보다 어느 정도 성장했는가”를 보여줍니다. 전기 대비가 단기 움직임을 드러낸다면 전년 동기 대비는 연간 흐름을 확인하는 도구라고 구분할 수 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;공식 통계에서는 전기 대비를 제시할 때 반복되는 계절 요인을 통계적으로 조정한 계절조정계열을 활용하기도 합니다. 원자료인 원계열과 계절조정계열은 계산 조건이 다르므로 같은 표 안에서도 어떤 계열인지 확인해야 합니다. 관련 개념과 실제 통계표는 통계청의 &lt;a href=&quot;https://kosis.kr/&quot; target=&quot;_blank&quot; rel=&quot;noopener noreferrer&quot;&gt;국가통계포털 KOSIS&lt;/a&gt;와 한국은행의 &lt;a href=&quot;https://ecos.bok.or.kr/&quot; target=&quot;_blank&quot; rel=&quot;noopener noreferrer&quot;&gt;경제통계시스템 ECOS&lt;/a&gt;에서 통계표 설명, 주석, 계열 구분과 함께 확인할 수 있습니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;매출은 계속 늘어도 성장 속도가 둔화할 수 있을까요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;분기별 매출이 매번 늘지만 증가 폭은 차츰 줄어드는 가상 장면을 놓고 계산해 보겠습니다. 아래 금액은 지표 읽기를 위한 가정값이며 특정 기업이나 업종의 실제 실적이 아닙니다. 행에는 시간 순서에 따른 분기를 배치하고, 열에는 매출액과 두 비교 기준의 증가율을 나누어 같은 금액이 어떻게 다르게 읽히는지 보여줍니다.&lt;/p&gt;
&lt;table style=&quot;width: 100%; border-collapse: collapse; margin: 16px 0;&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;thead&gt;
&lt;tr&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;분기&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;매출액&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;직전 분기 대비 증가율&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;전년 같은 분기 대비 증가율&lt;/th&gt;&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;1년 차 1분기&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;100억 원&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;비교 자료 없음&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;비교 자료 없음&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;1년 차 2분기&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;112억 원&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;12.0%&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;비교 자료 없음&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;1년 차 3분기&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;122억 원&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;8.9%&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;비교 자료 없음&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;1년 차 4분기&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;129억 원&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;5.7%&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;비교 자료 없음&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;2년 차 1분기&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;134억 원&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;3.9%&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;34.0%&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;2년 차 2분기&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;138억 원&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;3.0%&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;23.2%&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;2년 차 3분기&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;141억 원&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;2.2%&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;15.6%&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;2년 차 4분기&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;143억 원&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;1.4%&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;10.9%&lt;/td&gt;&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;관찰 장면은 2년 차 2분기입니다. 표에서 138억 원을 손가락으로 따라가며 왼쪽의 직전 분기와 위쪽의 전년 같은 분기를 각각 찾으면 비교 기준이 선명해집니다. 직전 분기인 134억 원과 비교하면 4억 원 늘어 약 3.0% 증가했습니다. 전년 같은 분기인 112억 원과 비교하면 26억 원 늘어 약 23.2% 증가한 결과가 나옵니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;같은 138억 원인데도 3.0%와 23.2%라는 서로 다른 숫자가 나오는 이유는 분모가 다르기 때문입니다. 전자는 최근 한 분기의 완만한 증가를, 후자는 1년 동안 누적된 비교적 큰 변화를 보여줍니다. 어느 한쪽이 틀린 것이 아니라 서로 다른 시간 간격을 설명하고 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;전체 표를 보면 매출액은 100억 원에서 143억 원까지 한 번도 줄지 않았습니다. 반면 전기 대비 증가율은 12.0%에서 1.4%로 낮아졌고, 계산 가능한 2년 차의 전년 동기 대비 증가율도 34.0%에서 10.9%로 내려갔습니다. 이때 적절한 표현은 “매출이 감소했다”가 아니라 “매출은 증가하고 있으나 성장 속도는 둔화하고 있다”입니다. 증가율의 하락과 매출액의 하락을 구별해야 하는 이유가 여기에 있습니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;경제 기사의 증가율은 어떤 순서로 읽어야 할까요?&lt;/h2&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;비교 기간과 원래 금액을 함께 봅니다&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기사에서 퍼센트를 발견하면 비교 기간부터 확인하는 편이 안전합니다. ‘전기’가 전월인지 전분기인지, ‘동기’가 같은 달인지 같은 분기인지 살펴야 합니다. 그다음 현재 금액과 기준 금액을 나란히 놓으면 비율은 크지만 실제 금액 차이는 작은 사례를 가려낼 수 있습니다. 증가율만 떼어 읽으면 사업 규모가 다른 기업을 부정확하게 비교하기 쉽습니다.&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;원계열과 계절조정계열을 섞지 않습니다&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;계절조정은 매년 비슷한 시기에 반복되는 변동을 추정해 단기 흐름을 더 잘 볼 수 있도록 만든 통계 처리입니다. 그렇다고 날씨나 일회성 행사 같은 모든 변동이 사라지는 것은 아닙니다. 통계표의 계열명과 주석에서 원계열인지 계절조정계열인지 확인하고, 전기 대비 수치가 어느 계열에서 계산됐는지 살펴야 합니다. 한국은행 ECOS의 통계표도 계열명과 주석을 함께 제공하므로 수치만 복사하기보다 설명을 같이 읽는 습관이 필요합니다.&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;기저효과와 매출 증가 원인을 구분합니다&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;전년 동기 대비가 높아도 지난해에 휴업이나 공급 차질이 있었다면 낮은 기준값의 영향일 수 있습니다. 반대로 증가율이 낮아졌더라도 기준이 된 전년 매출이 이미 높았다면 현재 실적이 나쁘다고 단정하기 어렵습니다. 최소 2년 이상의 금액 흐름을 확인해야 기저효과를 짐작할 수 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;매출 증가가 판매량 증가를 뜻하는지도 별개의 문제입니다. 가격 인상, 환율 변화, 신규 점포, 인수합병, 회계 기준 변경만으로 명목 매출이 커질 수 있습니다. 증가율은 변화의 크기를 압축해 보여주지만 원인까지 설명하지는 않습니다. 판매량, 평균 판매가격, 영업일 수처럼 해당 업종에 맞는 보조 정보가 필요합니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;한 문장의 실적 표현은 어떻게 판단해야 할까요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;“전년 동기 대비 매출은 증가했지만 전기 대비 증가 폭은 둔화했다”는 문장은 모순이 아닙니다. 전년 동기 대비 증가에는 지난 1년의 변화가 반영되고, 전기 대비에는 가장 최근 기간의 변화가 반영됩니다. 연간 수준으로는 성장했지만 최근의 추진력은 약해진 상황에서 두 표현이 동시에 성립할 수 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;반대 장면도 가능합니다. 전년 동기 대비로는 감소했지만 전기 대비로는 반등할 수 있습니다. 1년 전 수준에는 아직 못 미치지만 직전 분기보다 회복됐다는 뜻입니다. 이 경우 ‘역성장’과 ‘회복’이라는 표현이 기사마다 달리 강조될 수 있으므로 제목보다 기준 시점과 실제 금액을 확인해야 합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;실적을 읽을 때는 현재 매출액, 직전 기간 대비 변화, 전년 같은 기간 대비 변화, 계열의 조정 여부를 한 묶음으로 보는 것이 좋습니다. 여기에 전년 기준값의 특이성과 가격·판매량 변화를 보태면 숫자의 의미와 한계를 함께 판단할 수 있습니다. 통계는 공식을 외워 정답을 붙이는 과목이라기보다, 어떤 비교가 선택됐고 무엇이 생략됐는지를 묻는 생활 속 판단 도구에 가깝습니다.&lt;/p&gt;</description>
      <category>경제기사</category>
      <category>계절조정</category>
      <category>기저효과</category>
      <category>매출증가율</category>
      <category>비교기간</category>
      <category>성장둔화</category>
      <category>실적분석</category>
      <category>전기대비</category>
      <category>전년동기대비</category>
      <category>통계해석</category>
      <author>그래프 한입</author>
      <guid isPermaLink="true">https://dailyworklog.tistory.com/103</guid>
      <comments>https://dailyworklog.tistory.com/103#entry103comment</comments>
      <pubDate>Thu, 6 Aug 2026 13:20:57 +0900</pubDate>
    </item>
    <item>
      <title>건수와 비율 비교, 지역 순위 판단</title>
      <link>https://dailyworklog.tistory.com/102</link>
      <description>&lt;h2 data-ke-size=&quot;size26&quot;&gt;전체 건수만으로 지역을 평가하면 왜 문제가 될까요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;지역별 교통사고, 범죄, 민원, 환자 수를 비교할 때 가장 눈에 잘 들어오는 숫자는 전체 건수입니다. 건수는 일정 기간에 사건이 몇 번 발생했는지 보여 주므로 처리 인력, 응급 대응, 행정 예산처럼 필요한 자원의 총량을 판단하는 데 유용합니다. 사고가 5,000건 발생한 지역은 1,000건 발생한 지역보다 현장 업무가 많을 가능성이 큽니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그러나 지역의 상대적인 위험을 묻는다면 분자만 비교해서는 곤란합니다. 인구 500만 명인 지역의 5,000건과 인구 50만 명인 지역의 1,000건은 주민 규모가 크게 다릅니다. 전체 건수만으로 순위를 정하면 ‘사건이 많이 발생한 곳’과 ‘같은 수의 주민을 기준으로 발생 수준이 높은 곳’을 혼동하게 됩니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서 규모가 다른 지역이나 기관을 평가할 때는 비교 목적을 분명히 정하고 동일한 분모를 적용해야 합니다. 자원 수요를 파악하려는지, 주민당 발생 수준을 비교하려는지에 따라 적절한 지표와 순위가 달라집니다. 통계에서 중요한 것은 어느 숫자가 무조건 우월한지가 아니라 그 숫자가 어떤 질문에 답하는지 판단하는 일입니다.&lt;/p&gt;

&lt;h2 data-ke-size=&quot;size26&quot;&gt;같은 분모를 적용하면 순위는 어떻게 달라질까요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다음 표는 계산 원리를 설명하기 위해 단순화한 가정 자료입니다. 행에는 네 지역을 놓고, 열에는 연간 사고 건수, 인구, 인구 10만 명당 사고 건수와 두 가지 순위를 구분했습니다. 실제 지역의 교통안전 수준을 나타내는 자료는 아닙니다.&lt;/p&gt;
&lt;table style=&quot;width: 100%; border-collapse: collapse; margin: 16px 0;&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;thead&gt;
&lt;tr&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;지역&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;연간 사고 건수&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;인구&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;인구 10만 명당 사고 건수&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;전체 건수 순위&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;인구당 사고 순위&lt;/th&gt;&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;가 지역&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;5,000건&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;500만 명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;100건&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;1위&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;4위&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;나 지역&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;3,600건&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;200만 명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;180건&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;2위&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;2위&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;다 지역&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;2,400건&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;100만 명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;240건&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;3위&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;1위&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;라 지역&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;1,000건&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;50만 명&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;200건&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;4위&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;3위&lt;/td&gt;&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;표를 전체 건수 열로 정렬하면 가 지역이 1위이고 라 지역이 4위입니다. 같은 표를 인구 10만 명당 사고 건수 열로 다시 정렬하는 장면에서는 다 지역이 1위로 올라가고 가 지역은 4위로 내려갑니다. 데이터 표를 검토할 때 이 두 열을 번갈아 정렬해 보는 것만으로도 분모가 지역 평가를 어떻게 바꾸는지 구체적으로 관찰할 수 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;계산식은 ‘사고 건수 ÷ 인구 × 100,000’입니다. 다 지역은 2,400을 1,000,000으로 나눈 뒤 100,000을 곱하므로 240건입니다. 가 지역은 5,000건으로 사건 총량이 가장 크지만, 주민 10만 명을 같은 기준으로 놓으면 100건으로 가장 낮습니다. 10만 명이라는 단위는 소수를 읽기 쉬운 숫자로 바꾸는 환산 기준일 뿐이며, 계산 대상 모두에 똑같이 적용해야 합니다.&lt;/p&gt;

&lt;h2 data-ke-size=&quot;size26&quot;&gt;건수와 비율은 각각 어떤 결정에 써야 할까요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;전체 건수는 “어디에서 처리해야 할 사건이 가장 많은가”라는 질문에 답합니다. 사고 조사 인력, 구급 대응, 민원 처리 창구처럼 업무량에 비례해 자원을 배치할 때는 실제 건수를 빼놓을 수 없습니다. 위 사례에서는 사고율이 낮더라도 5,000건을 처리해야 하는 가 지역의 업무 부담이 가장 클 수 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;인구당 비율은 “인구 규모를 같게 맞추었을 때 어느 지역의 발생 수준이 높은가”를 살피는 지표입니다. 예방 정책의 우선 대상이나 지역 간 상대적 차이를 검토할 때 건수보다 직접적인 근거가 됩니다. 위 표에서는 다 지역이 이에 해당하지만, 비율 1위라는 사실만으로 사고 처리 인력을 가장 많이 배정해야 한다고 결론 내릴 수는 없습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;실무 보고서에서는 두 지표를 경쟁시키기보다 나란히 제시하는 편이 낫습니다. 건수는 대응 규모를, 비율은 상대적 발생 수준을 설명합니다. 정책 우선순위를 정할 때 비율을 참고하고 실제 인력과 예산을 산정할 때 건수를 함께 반영하면 서로 다른 질문을 한 순위에 억지로 담는 오류를 줄일 수 있습니다.&lt;/p&gt;

&lt;h2 data-ke-size=&quot;size26&quot;&gt;인구당 사고 건수의 분모와 집계 기준은 어떻게 맞출까요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;인구 10만 명당 사고 건수는 특정 기간과 지역에서 집계한 교통사고 건수를 같은 지역의 인구로 나눈 뒤 100,000을 곱한 값입니다. 실제 통계를 적용할 때 분자는 &lt;a href=&quot;https://taas.koroad.or.kr/&quot; rel=&quot;noopener noreferrer&quot;&gt;도로교통공단 교통사고분석시스템(TAAS)&lt;/a&gt;에서 사고 발생지역 기준으로 집계한 연간 사고 건수를 사용할 수 있습니다. 분모는 &lt;a href=&quot;https://kosis.kr/&quot; rel=&quot;noopener noreferrer&quot;&gt;국가통계포털(KOSIS)&lt;/a&gt;의 같은 지역·같은 연도 주민등록인구처럼 기준이 명시된 자료를 선택해야 합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;예를 들어 2025년 지역별 사고를 비교한다면 분자는 2025년 1월 1일부터 12월 31일까지의 사고 발생 건수로 통일하고, 분모는 2025년 12월 31일 기준 주민등록인구를 쓰는 방식처럼 기준 시점을 보고서에 밝혀야 합니다. 연평균 인구를 사용했다면 그 사실도 따로 적어야 합니다. 연간 사고 건수와 다른 연도의 인구, 발생지 기준 사고와 거주지 기준 인구를 설명 없이 섞으면 계산은 가능해도 해석의 경계가 흐려집니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;인구가 언제나 최선의 분모인 것도 아닙니다. 주민의 생활 안전을 넓게 비교할 때는 인구가 이해하기 쉽지만 운전 노출을 분석하려면 등록 차량 수, 운전면허 보유자 수, 차량 주행거리 또는 도로 통행량이 더 적합할 수 있습니다. 관광지나 업무 중심지는 거주 인구보다 유동 인구가 훨씬 많아 인구당 수치가 실제 도로 노출을 충분히 나타내지 못할 수 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;공식 자료를 인용할 때는 자료명만 적지 말고 사고의 정의, 집계 기간, 발생지역 범위, 인구 기준일을 해당 수치와 함께 표시하는 것이 좋습니다. TAAS와 KOSIS에서도 표마다 분류 기준과 갱신 시점이 다를 수 있으므로 내려받은 표의 주석과 기준일을 최종 작성 시점에 다시 확인해야 합니다.&lt;/p&gt;

&lt;h2 data-ke-size=&quot;size26&quot;&gt;지역 순위를 해석할 때 어떤 한계를 점검해야 할까요?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;비율은 규모 차이를 조정하지만 작은 지역에서는 크게 흔들립니다. 인구가 적은 곳은 사고 몇 건의 증감만으로도 인구 10만 명당 수치와 순위가 급격히 바뀔 수 있습니다. 한 해의 순위만 제시하기보다 최근 여러 해의 건수와 비율을 함께 놓고 변화가 지속되는지 확인해야 우연한 변동을 정책 성과로 오해하지 않습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;순위 자체는 차이의 크기도 숨깁니다. 1위와 2위의 사고율 차이가 1건뿐인 경우와 100건인 경우는 의미가 다르지만 순위표에서는 모두 한 계단 차이로 보입니다. 순위를 제시할 때 실제 비율, 지역 간 격차, 전년 대비 변화량을 함께 읽어야 합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;도로 구조, 차량 통행량, 관광객, 신고 방식, 사고 분류 변경 같은 조건도 결과에 영향을 줍니다. 인구당 사고율이 높다는 사실은 추가 조사가 필요한 신호이지 특정 지역의 주민 행동이나 행정 성과가 나쁘다는 판정문이 아닙니다. 규모가 다른 집단을 공정하게 비교하려면 동일한 분모가 필요하지만, 올바른 분모를 골랐다고 해서 모든 배경 차이까지 사라지는 것은 아닙니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;결국 지역 순위는 목적에 맞게 나누어 읽어야 합니다. 전체 건수로 업무 총량을 확인하고, 동일한 분모의 비율로 상대적 발생 수준을 비교하며, 기간·지역 범위·분모 기준일과 노출 조건을 함께 밝혀야 합니다. 통계는 순위를 만드는 공식이 아니라 생활 속 숫자가 무엇을 말하고 어디까지 말할 수 있는지 판단하는 도구입니다.&lt;/p&gt;</description>
      <category>건수비교</category>
      <category>교통사고</category>
      <category>분모설정</category>
      <category>비율분석</category>
      <category>인구당사고율</category>
      <category>정책우선순위</category>
      <category>지역간비교</category>
      <category>지역순위</category>
      <category>지표선정</category>
      <category>통계해석</category>
      <author>그래프 한입</author>
      <guid isPermaLink="true">https://dailyworklog.tistory.com/102</guid>
      <comments>https://dailyworklog.tistory.com/102#entry102comment</comments>
      <pubDate>Thu, 6 Aug 2026 02:30:19 +0900</pubDate>
    </item>
    <item>
      <title>히스토그램 보는 법, 분포 모양 읽기</title>
      <link>https://dailyworklog.tistory.com/101</link>
      <description>&lt;h2 data-ke-size=&quot;size26&quot;&gt;히스토그램은 막대그래프와 무엇이 다른가&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;히스토그램은 배달시간, 키, 시험 점수처럼 수치로 측정한 자료를 일정한 구간으로 묶어 분포를 보여 주는 그래프입니다. 개별 값의 정확한 위치는 줄어들지만 값이 어디에 몰리고 얼마나 퍼져 있는지는 한눈에 드러납니다. 통계를 읽는 목적은 모양의 이름을 외우는 데 있지 않습니다. 생활 속 숫자가 무엇을 대표하며 무엇을 감추는지 판단하는 데 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;일반 막대그래프는 음식 종류나 지역처럼 서로 구별되는 범주의 크기를 비교합니다. 범주의 순서를 바꿀 수 있고 막대 사이를 띄우는 경우가 많습니다. 히스토그램의 가로축은 연속된 수치 구간이므로 순서를 임의로 바꿀 수 없으며 막대도 보통 붙여 그립니다. 높이가 가장 큰 막대는 최빈 구간을 뜻할 뿐, 평균이나 중앙값이 반드시 그 안에 있다는 뜻은 아닙니다.&lt;/p&gt;
&lt;table style=&quot;width: 100%; border-collapse: collapse; margin: 16px 0;&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;thead&gt;&lt;tr&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;비교 기준&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;히스토그램&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;일반 막대그래프&lt;/th&gt;&lt;/tr&gt;&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;가로축&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;배달시간처럼 이어지는 수치 구간&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;메뉴처럼 서로 구별되는 범주&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;막대 순서&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;수치의 크기 순서로 고정&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;비교 목적에 따라 변경 가능&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;읽는 목적&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;집중 위치, 퍼짐, 봉우리와 꼬리 확인&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;범주별 크기 비교&lt;/td&gt;&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;막대 높이보다 앞서 확인할 것은 무엇인가&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;가로축에서 측정 변수와 단위를 읽고, 각 구간의 시작점과 끝점을 확인해야 합니다. 세로축이 주문 건수인지 비율인지도 구분합니다. 조사 대상, 기간, 전체 표본 수도 함께 살펴야 합니다. 주문 20건에서 생긴 작은 굴곡과 주문 2만 건에서 반복된 굴곡은 같은 무게로 해석하기 어렵기 때문입니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;구간 폭은 분포의 인상을 크게 바꿉니다. 같은 자료도 2분 단위로 자르면 작은 봉우리가 여럿 나타날 수 있고, 10분 단위로 묶으면 하나의 완만한 봉우리처럼 보일 수 있습니다. 두 히스토그램을 비교하려면 가로축 범위와 구간 경계가 같은지 확인해야 합니다. 구간 설정이 다르면 막대 높이를 그대로 견주어서는 안 됩니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;특히 구간 폭이 서로 다를 때는 세로축을 빈도밀도로 두고, 막대의 넓이가 해당 구간의 빈도 또는 비율을 나타내도록 해야 합니다. 빈도밀도는 빈도를 구간 폭으로 나눈 값입니다. 폭이 10분인 막대가 폭이 5분인 막대보다 높다는 이유만으로 자료가 더 조밀하다고 판단하면 안 됩니다. 이 경우에는 높이가 아니라 ‘폭×높이’인 넓이를 비교해야 합니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;봉우리와 꼬리는 어떻게 해석하는가&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;봉우리는 관측값이 많이 모인 구간입니다. 가운데에 봉우리 하나가 있고 양쪽 막대가 비슷하게 낮아지면 비교적 대칭적인 분포로 볼 수 있습니다. 다만 종처럼 보인다는 이유만으로 곧바로 정규분포라고 단정할 수는 없습니다. 표본 수와 구간 설정에 따라 비슷한 모양이 만들어질 수 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;한쪽으로 낮은 막대가 길게 이어지면 치우친 분포입니다. 배달시간의 오른쪽 꼬리가 길다면 대부분은 평소 범위에 도착했지만 일부 주문이 크게 늦었을 가능성이 있습니다. 큰 값은 평균을 오른쪽으로 끌어당기므로 중앙값과 지연 주문의 비율을 함께 보는 편이 낫습니다. 왼쪽 꼬리가 길다면 유난히 빠른 주문뿐 아니라 측정 하한이나 입력 방식도 점검할 필요가 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;봉우리가 두 개라면 점심과 저녁, 가까운 지역과 먼 지역처럼 서로 다른 조건의 집단이 섞였는지 의심할 수 있습니다. 그래프만으로 원인을 확정할 수는 없습니다. 주문 시각이나 거리로 자료를 나누어 다시 그렸을 때 봉우리가 유지되는지 확인해야 합니다. 떨어진 막대 하나 역시 이상값일 수 있지만 실제 사고나 기상 악화가 반영된 값일 수도 있으므로 임의로 삭제해서는 안 됩니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;평균 30분인 세 자료를 직접 비교해 보기&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;평균이 모두 30분인 세 가상 자료를 같은 구간에 넣어 보면 평균만으로 분포를 설명하기 어려운 이유가 선명해집니다. 아래 배열은 실제 업체 자료가 아니라 계산과 관찰을 위한 예시입니다. 각 배열은 10개 값의 합이 300이므로 평균은 300÷10=30분입니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;대칭형은 20, 24, 27, 29, 30, 30, 31, 33, 36, 40입니다. 오른쪽 꼬리형은 20, 22, 24, 25, 26, 27, 28, 29, 49, 50입니다. 두 봉우리형은 21, 22, 23, 24, 25, 35, 36, 37, 38, 39입니다. 구간은 20분 이상 25분 미만부터 5분 간격으로 통일하고, 마지막 구간만 45분 이상 50분 이하로 잡았습니다.&lt;/p&gt;
&lt;table style=&quot;width: 100%; border-collapse: collapse; margin: 16px 0;&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;thead&gt;&lt;tr&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;배달시간 구간&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;대칭형 빈도&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;오른쪽 꼬리형 빈도&lt;/th&gt;&lt;th style=&quot;border: 1px solid #d9d9d9; padding: 10px; background-color: #f6f7f8; text-align: left;&quot;&gt;두 봉우리형 빈도&lt;/th&gt;&lt;/tr&gt;&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;20분 이상 25분 미만&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;2&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;3&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;4&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;25분 이상 30분 미만&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;2&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;5&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;1&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;30분 이상 35분 미만&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;4&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;0&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;0&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;35분 이상 40분 미만&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;1&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;0&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;5&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;40분 이상 45분 미만&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;1&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;0&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;0&lt;/td&gt;&lt;/tr&gt;
&lt;tr&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;45분 이상 50분 이하&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;0&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;2&lt;/td&gt;&lt;td style=&quot;border: 1px solid #d9d9d9; padding: 10px; vertical-align: top;&quot;&gt;0&lt;/td&gt;&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;표의 빈도를 같은 폭의 막대로 옮겨 그리면 첫 자료는 30분 부근에 집중되고, 둘째 자료는 빠른 주문이 많지만 49분과 50분이 긴 오른쪽 꼬리를 만듭니다. 셋째 자료에서는 30분 부근에 주문이 하나도 없는데도 평균은 30분입니다. 독자는 각 행의 빈도를 직접 세어 합계가 10인지 검산한 뒤, 평균을 가리고 어느 서비스가 일정한지 또는 심한 지연 위험이 있는지 판단해 볼 수 있습니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;해석 전에 적용할 점검 순서&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그래프를 받을 때는 변수와 단위, 조사 대상과 기간을 읽습니다. 이어 구간 경계와 폭, 세로축의 기준을 확인하고 자료가 집중된 위치와 전체 범위를 봅니다. 그다음 봉우리 수, 좌우 대칭 여부, 긴 꼬리와 떨어진 값을 살핍니다. 평균과 중앙값은 이 모양을 확인한 뒤 연결해야 숫자를 과도하게 대표값 하나로 압축하지 않게 됩니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;표본이 적으면 우연한 굴곡이 특징처럼 보이고, 구간이 너무 넓으면 두 집단이나 이상값이 가려질 수 있습니다. 히스토그램이 보여 주는 것은 관측된 분포의 형태입니다. 왜 그런 형태가 생겼는지는 추가 변수와 수집 과정을 조사해야 알 수 있습니다. 보이는 사실과 원인에 대한 추정을 구분하는 태도가 통계 해석의 핵심입니다.&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;정의와 해석 원칙을 확인할 자료&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;히스토그램의 정의와 구간별 빈도 해석은 미국 국립표준기술연구소의 &lt;a href=&quot;https://www.itl.nist.gov/div898/handbook/eda/section3/histogra.htm&quot; rel=&quot;noopener noreferrer&quot;&gt;NIST/SEMATECH e-Handbook of Statistical Methods&lt;/a&gt;에서 확인할 수 있습니다. 분포의 모양, 중심, 퍼짐을 함께 살피는 기초 원칙은 &lt;a href=&quot;https://openstax.org/books/introductory-statistics/pages/2-introduction&quot; rel=&quot;noopener noreferrer&quot;&gt;OpenStax Introductory Statistics&lt;/a&gt;의 기술통계 단원과도 연결됩니다. 출처를 확인하더라도 실제 그래프의 구간 폭과 축 표시는 별도로 읽어야 합니다.&lt;/p&gt;</description>
      <category>구간폭</category>
      <category>대칭분포</category>
      <category>막대그래프</category>
      <category>배달시간</category>
      <category>분포해석</category>
      <category>빈도밀도</category>
      <category>이상값</category>
      <category>최빈구간</category>
      <category>치우친분포</category>
      <category>히스토그램</category>
      <author>그래프 한입</author>
      <guid isPermaLink="true">https://dailyworklog.tistory.com/101</guid>
      <comments>https://dailyworklog.tistory.com/101#entry101comment</comments>
      <pubDate>Wed, 5 Aug 2026 23:20:56 +0900</pubDate>
    </item>
  </channel>
</rss>