본문 바로가기

AI 윤리 원칙과 책임 있는 AI 활용

법은 "여기서부터는 처벌한다"는 최저선입니다. AI 윤리는 그 위에서 "여기까지는 가지 말자"의 합의입니다. 이번 회차의 주제는 그 합의가 어떤 모양인지, 그리고 보안 도구에서 그 원칙이 어떻게 작동해야 하는지입니다.

왜 윤리가 따로 필요한가

앞 회차에서 본 AI 기본법 6개 원칙(인간 존엄·안전성·신뢰성·투명성·공정성·책임성)이 사실은 모두 윤리에서 출발한 것입니다. 법이 미처 다루지 못한 회색지대를 안내해 주는 것이 윤리의 역할이고, 보안 도구처럼 빠르게 진화하는 영역에서는 법보다 윤리가 먼저 작동해야 합니다.

1. AI 윤리의 국제 기준

AI 윤리 원칙은 여러 기관이 발표했지만, 핵심은 거의 같습니다. 자주 인용되는 다섯 개의 표준만 봅니다.

기관발표핵심
OECD AI 권고안2019, 2024 개정5개 원칙: 포용·인간 존엄·투명성·견고성·책임성
UNESCO AI 윤리 권고20214개 가치 + 10개 원칙
EU AI HLEG 신뢰가능 AI 가이드라인20197개 요건
IEEE Ethically Aligned Design20198개 원칙
G20 AI 원칙2019OECD 원칙을 채택

이 다섯 표준을 가로질러 보면 5개의 공통 기둥이 보입니다.

이 다섯 기둥이 우리가 이번 회차에서 풀어볼 핵심 개념들입니다.

2. OECD AI 원칙 (2019, 2024 개정)

OECD 원칙은 가장 자주 인용되고, 한국 AI 기본법의 6개 원칙과도 가장 가까운 모습입니다. 5개 원칙입니다.

원칙의미
포용적 성장과 웰빙AI는 사람과 지구의 이익을 위해 작동해야 한다
인간 중심 가치와 공정성인권, 민주적 가치를 존중하고 차별 없이
투명성과 설명 가능성시스템이 어떻게 작동하는지 이해할 수 있게
견고성, 안전성, 보안오작동·악용에 견디는 시스템
책임성AI 시스템에 대한 명확한 책임 소재

2024년 개정에서는 생성형 AI와 기반 모델(Foundation Model)이 명시적으로 추가되었습니다. 이는 한국 AI 기본법 제33조의 "영향력이 큰 AI"와 직접 대응됩니다.

3. EU AI HLEG의 7개 요건

EU AI 고위전문가그룹(High-Level Expert Group on AI)이 2019년 발표한 「신뢰가능한 AI 가이드라인」은 가장 구체적인 항목으로 구성됩니다.

요건핵심
1. 인간의 행위와 감독AI는 인간 결정을 지원하되 대체하지 않는다
2. 기술적 견고성과 안전적대적 입력·오작동 대응
3. 프라이버시와 데이터 거버넌스데이터 품질, 접근 통제, 보안
4. 투명성추적 가능성, 설명 가능성, 의사소통
5. 다양성, 차별 금지, 공정성편향 점검, 접근성, 다양한 이해관계자 참여
6. 사회·환경 웰빙지속가능성, 사회적 영향
7. 책임성감사 가능성, 위험 최소화, 보상

이 7개 요건이 EU AI Act의 의무 조항으로 그대로 들어갔습니다. 윤리에서 시작해 법으로 정착하는 흐름의 모범 사례입니다.

4. 다섯 기둥 깊이 보기

다섯 기둥을 보안 도구에서 어떻게 구현하는지 하나씩 살펴봅니다.

4.1 공정성 (Fairness)

공정성은 AI가 특정 집단을 부당하게 차별하지 않는 것입니다. "모든 사용자에게 같은 출력을 내는 것"이 아니라, 사회적으로 수용 가능한 차이만 두는 것이 공정성입니다.

차별이 일어나는 자리

영역어떻게 일어나나
학습 데이터 편향과거 데이터에 차별이 들어 있어 모델이 그대로 학습
표본 불균형특정 인구 집단의 데이터가 적어 그 집단에 대한 정확도 낮음
레이블 편향사람이 매긴 레이블에 무의식적 편향
목적 함수 편향최적화 목표가 특정 집단에 불리

보안 도구에서의 공정성 위험

보안 도구잠재적 차별 자리
사기 탐지(FDS)특정 지역·연령대 거래 과대 차단
침입 탐지(IDS)비영어권 사용자의 정상 행동을 비정상으로 분류
부정 사용자 탐지특정 디바이스·통신사 사용자에 불리한 판단
콘텐츠 모더레이션특정 언어·문화권 표현을 위협으로 오분류

공정성 점검 절차

1. 보호 속성 정의 (성별, 연령, 지역, 언어 등)
2. 각 보호 속성 그룹별 모델 성능 측정 (정확도, 정밀도, 재현율)
3. 그룹 간 성능 격차 측정 (Disparate Impact, Equal Opportunity Difference)
4. 격차가 임계값 초과 시 데이터 보강 또는 모델 조정
5. 운영 후 정기적 재측정 (분기 단위 권장)

5. 투명성 (Transparency)

투명성은 AI 시스템이 무엇을 하고 있는지 외부에서 이해할 수 있는 정도입니다. 세 단계로 나눠 봅니다.

5.1 투명성의 세 층위

층위의미누구를 위해
존재의 투명성"이건 AI다"라는 표시일반 사용자
작동의 투명성무엇을 학습했고 어떻게 결정하는가규제기관, 감사
결정의 투명성이번 결정의 근거 (XAI)영향받는 사용자

이 셋은 깊이가 다릅니다. AI 기본법 제31조의 표시 의무는 1번 층위, 제27조의 설명 가능성은 3번 층위에 해당합니다.

5.2 설명 가능 AI (Explainable AI, XAI)

설명 가능성은 모델 종류에 따라 난이도가 다릅니다.

모델설명 가능성도구
결정 트리, 선형 회귀본질적으로 설명 가능모델 자체
랜덤 포레스트변수 중요도, SHAPscikit-learn, SHAP
신경망(중간 규모)LIME, SHAP, 통합 그래디언트LIME, Captum
대규모 언어 모델본질적으로 어려움. 사후 설명만 가능Anthropic Mechanistic Interpretability 등

보안 도구에서 LLM을 쓴다면, 그 자체로 설명 가능성이 약합니다. 이를 보완하기 위해 별도 분류기 + LLM 조합을 쓰는 패턴이 자주 사용됩니다. 분류기가 "이 거래가 사기일 확률 X%"를 계산하고, LLM은 그 결과의 자연어 설명을 만드는 방식입니다.

5.3 모델 카드(Model Card)와 데이터 시트

투명성을 문서로 보여주는 표준 형식입니다.

문서내용
모델 카드모델의 용도, 성능, 한계, 학습 데이터, 평가 결과
데이터 시트학습 데이터의 출처, 수집 방법, 편향, 라이선스
시스템 카드모델을 포함한 전체 시스템의 통합 정보

OpenAI, Google, Meta 같은 대형 모델 사업자는 모두 모델 카드를 발행합니다. 이용사업자도 자체 모델·시스템에 대해 같은 문서를 만들어 두는 것이 표준입니다.

6. 책임성 (Accountability)

책임성은 AI가 잘못된 결과를 냈을 때 누가 책임지는가의 문제입니다.

6.1 책임의 분배 모델

AI 사고는 보통 한 명의 책임이 아닙니다. 모델, 데이터, 운영, 사용자 입력이 결합되어 일어나기 때문입니다. 그래서 책임성은 다음 두 측면을 같이 관리해야 합니다.

측면의미
인과 책임누구의 어떤 행위가 결과를 만들었는가
법적 책임누가 손해배상·과징금의 부담을 지는가
도덕적 책임누가 사회적으로 해명해야 하는가

6.2 책임 추적성 (Traceability)

사고가 났을 때 책임을 추적하려면 다음 기록이 필요합니다.

영역기록 항목
학습 데이터출처, 수집 시점, 가명처리 여부, 라이선스
모델 학습하이퍼파라미터, 학습 코드 버전, 평가 결과
배포모델 버전, 배포 시점, 변경 이력
운영입력·출력 로그(필요한 만큼), 오류 기록
의사결정자동 결정 로그, 사람의 재검토 기록

이 기록을 합쳐 부르는 것이 AI 감사 추적(AI Audit Trail)입니다. 보안 도구의 경우 일반 시스템 로그에 더해 모델 단위 로그를 별도로 관리해야 합니다.

7. 프라이버시와 데이터 거버넌스

AI 윤리의 프라이버시 원칙은 6장의 개인정보보호법 의무와 직접 연결됩니다. 차이는 AI 학습·운영의 특수성을 반영한다는 점입니다.

7.1 학습 데이터의 프라이버시

단계위험대응
수집동의 범위 초과 수집처리 목적 명시, 가명처리
학습데이터가 모델에 "기억"됨차분 프라이버시(Differential Privacy)
추론멤버십 추론 공격으로 학습 데이터 노출출력 정규화, 추론 모니터링
저장학습 데이터 유출암호화, 접근 통제

특히 모델이 학습 데이터를 기억(Memorization)하는 문제가 LLM에서 두드러집니다. ChatGPT 초기에 학습 데이터에 포함된 특정 인물의 연락처를 그대로 재현한 사례들이 보고되었습니다.

7.2 운영 데이터의 프라이버시

LLM 기반 서비스는 사용자 입력이 그대로 모델에 들어갑니다. 이때 두 가지 위험이 있습니다.

위험의미
모델 학습 재활용사용자 입력이 다음 모델 학습에 쓰일 수 있음
다른 사용자 노출캐시·로그를 통한 다른 사용자 노출

OpenAI·Anthropic·구글 모두 API에서 입력된 데이터는 학습에 사용하지 않는다고 명시합니다(설정에 따라). 다만 무료 웹 인터페이스는 다를 수 있어, 회사에서 LLM을 쓸 때는 API 또는 엔터프라이즈 플랜으로 통일하는 것이 표준입니다.

현실 사례: 삼성전자 ChatGPT 입력 사고 (2023)

이 "표준"이 한국에서 본격적으로 자리 잡은 계기는 2023년 3월 삼성전자에서 보고된 세 건의 사고였습니다. 디바이스솔루션(DS) 사업부의 한 엔지니어가 반도체 설비 측정 프로그램 소스코드를 ChatGPT에 붙여 넣고 "오류를 좀 잡아 달라"고 부탁했고, 같은 주에 다른 엔지니어는 수율 관련 코드를, 또 다른 직원은 회의 음성을 텍스트로 바꾼 회의록을 정리해 달라고 입력했습니다. 한 달이 채 되지 않는 사이에 세 건이 연달아 보고됐죠.

흥미로운 점은 누구도 "악의"가 없었다는 것입니다. 모두 "조금 빨리 일하려고" 한 행동이고, 그 순간엔 입력한 데이터가 모델 학습으로 흘러갈 수 있다는 점이 직관적으로 보이지 않았습니다. 5장의 투명성 원칙이 단순한 "이건 AI예요" 표시가 아니라, 사용자가 입력 직전에 "이 데이터가 어디로 가는가"를 이해할 수 있어야 한다는 뜻임을 보여주는 자리입니다.

삼성전자는 4월부터 사내 생성형 AI 사용을 임시 차단하고 자체 LLM(Samsung Gauss) 개발로 방향을 틀었습니다. 이후 SK하이닉스·LG·금융사 대부분이 같은 시기에 사내 LLM이나 엔터프라이즈 플랜으로 정책을 정비했죠. 한국 대기업의 "LLM 사용 정책"이 거의 동시에 만들어진 분기점이었습니다.

참고 기사: 삼성, 챗GPT 데이터 유출 후 임직원 AI 사용 금지 (AI타임스) · 우려가 현실로… 삼성전자, 챗GPT 빗장 풀자마자 '오남용' 속출 (이코노미스트)

7.3 차분 프라이버시 (Differential Privacy)

수학적으로 정의된 프라이버시 보장입니다. 한 개인의 데이터가 학습에 들어가는지 여부를 통계적으로 구별할 수 없게 만드는 기법입니다.

ε-차분 프라이버시:
어떤 두 데이터셋 D1, D2가 단 한 개의 레코드만 다를 때,
그 두 데이터셋에서 학습한 모델의 출력 분포 차이가 e^ε 이내여야 함.

ε(엡실론)이 작을수록 프라이버시 강함, 정확도는 일반적으로 떨어짐.

Apple, Google이 일부 통계 수집에 적용하고 있고, 학술적으로는 이미 표준이 된 개념입니다. 보안 도구에서 사용자 행동 패턴을 학습할 때 차분 프라이버시를 도입하는 방향이 점점 표준이 되어 가고 있습니다.

8. 안전성과 견고성

AI의 안전성은 두 가지 자리에서 이야기됩니다.

자리의미
견고성 (Robustness)적대적 입력·노이즈·오류에 견디는 능력
AI SafetyAI가 의도와 다른 행동을 하지 않도록 하는 정렬 문제

8.1 적대적 공격에 대한 견고성

공격 유형의미보안 도구 영향
적대적 예제(Adversarial Example)사람 눈에는 멀쩡한 입력에 미묘한 노이즈를 더해 모델을 속임이미지 분류, 멀웨어 분류 우회
데이터 오염(Data Poisoning)학습 데이터에 악의적 샘플 주입정상 트래픽을 비정상으로 학습시키기
모델 추출(Model Extraction)API를 반복 호출해 모델 자체를 복제상용 보안 모델 도난
프롬프트 인젝션입력에 악성 명령을 숨겨 LLM 행동 변경LLM 기반 챗봇·어시스턴트

LLM 시대에 들어서 프롬프트 인젝션이 가장 자주 보고되는 공격이 되었습니다. 외부 문서를 LLM에 입력하는 모든 시스템(RAG, 에이전트, 자동화)에서 위험이 발생합니다.

8.2 견고성 확보 절차

단계무엇을 하는가
위협 모델링어떤 공격이 가능한가 정리
적대적 테스트의도적 적대 입력으로 평가
입력 검증모델 앞단에서 비정상 입력 차단
출력 검증모델 출력에 대한 후처리 점검
모니터링운영 중 비정상 패턴 감지
재학습새 공격 패턴 반영

이 절차는 4장에서 본 "안전한 비밀번호 저장"의 절차와 본질적으로 같습니다. 모델도 시스템이고, 시스템 보안 절차가 그대로 적용됩니다.

9. AI 편향이 보안 도구에 끼치는 영향

5개 기둥 중 공정성을 다시 한 번 깊이 봅니다. 보안 도구에서의 편향은 단순한 차별 문제를 넘어 보안 효과 자체를 무너뜨립니다.

9.1 편향이 보안을 무너뜨리는 자리

시나리오편향이 어떻게 작동하나
학습 데이터에 특정 OS 사용자 비율이 낮음그 OS의 정상 트래픽을 비정상으로 분류 → 가용성 저하
영어 외 언어 데이터가 적음한국어 피싱 메일을 정상으로 분류 → 보안 실패
과거 사기 데이터에 특정 지역 편중그 지역 정상 거래를 과도 차단 → 사용자 이탈
학습 시점 이후의 신종 공격학습되지 않은 패턴을 정상으로 분류 → 0-day에 무력

마지막 시나리오가 가장 위험합니다. 데이터 편향이라기보다 시간 편향(Temporal Bias)이라 불리는 자리로, AI 보안 도구의 가장 큰 약점이기도 합니다.

현실 사례: AI 면접의 차별과 UEBA의 닮은 위험 (한국, 2022~)

2022년 국가인권위원회는 공공기관 채용의 AI 면접 도구를 두고 "표정·시선·말투를 분석해 점수를 매기는 방식이 시각·청각·언어 장애가 있거나 특정 사회·문화적 배경을 가진 지원자에게 구조적으로 불리할 수 있다"는 입장을 냈습니다. 같은 해 여러 공공기관이 AI 면접 도입을 보류·재검토했고, 이후 민간 채용에서도 AI 면접 결과를 단독 판단 근거로 쓰지 않는 가이드라인이 자리잡아 갔습니다.

이게 보안 책에서 의미 있는 이유는, 같은 분석 엔진이 보안에도 들어간다는 점입니다. 키 입력 리듬, 마우스 움직임, 통화 음성 패턴, 결제 행동을 학습해 "이 사람이 본인이 맞는가"를 판단하는 UEBA(User and Entity Behavior Analytics) 솔루션이 그것이죠. 학습 데이터가 한국 표준어를 쓰는 도시 거주 20~30대 위주로 편중돼 있으면, 그 바깥에 있는 사용자, 가령 사투리가 강한 노년층, 손가락 움직임이 다른 장애인, 야간 근무자가 "비정상 사용자"로 더 자주 분류됩니다. 표 9.1의 첫 번째 행과 정확히 같은 구조의 차별이, 보안의 이름을 달고 운영되는 셈입니다.

참고 기사: 인공지능 개발과 활용에 관한 인권 가이드라인 마련 (국가인권위원회) · AI 면접의 그늘…장애인 역차별 등 알고리즘의 채용평가 부작용 우려 (파이낸셜뉴스)

9.2 편향 점검 도구

오픈소스 도구만으로도 기본적인 점검이 가능합니다.

도구무엇을 보는가
Fairlearn (Microsoft)그룹별 성능 격차, 완화 알고리즘
AIF360 (IBM)70여 개 공정성 메트릭, 편향 완화
What-If Tool (Google)모델 결과의 시나리오 분석
SHAP변수 중요도, 그룹별 기여도
# 가장 간단한 그룹별 성능 비교 (Fairlearn 예시)
# pip install fairlearn
from fairlearn.metrics import MetricFrame, selection_rate
from sklearn.metrics import accuracy_score

mf = MetricFrame(
    metrics={
        "accuracy": accuracy_score,
        "selection_rate": selection_rate,
    },
    y_true=y_test,
    y_pred=y_pred,
    sensitive_features=group_test,  # 보호 속성 (예: 지역, 연령대)
)
print(mf.by_group)
print("Disparity:", mf.difference())

이 출력에서 그룹 간 격차가 일정 임계값(예: 정확도 격차 5% 이상)을 넘으면 데이터 보강이나 모델 조정을 검토합니다.

10. 책임 있는 AI 사용 가이드라인 작성하기

이번 회차의 마무리는 본인이 속한 조직의 AI 사용 가이드라인을 직접 작성하는 활동입니다.

10.1 가이드라인 양식

# [회사명] 책임 있는 AI 사용 가이드라인 v1.0

## 1. 적용 범위
- 대상 시스템:
- 대상 인원:
- 적용 시점:

## 2. 기본 원칙
1. 공정성: ...
2. 투명성: ...
3. 책임성: ...
4. 프라이버시: ...
5. 안전성: ...

## 3. AI 도구 사용 규칙
### 3.1 허용된 AI 도구
- (예: Anthropic Claude API, OpenAI API, ...)

### 3.2 입력 금지 데이터
- 개인정보 (이름, 연락처, 주민번호, 계좌번호 등)
- 영업비밀, 고객 비공개 자료
- 법적 분쟁 관련 자료

### 3.3 결과물 사용 시 의무
- AI 사용 사실 명시
- 사람의 검토 필수
- 환각 가능성 점검

## 4. 자체 AI 시스템 개발 시 의무
- 모델 카드 작성
- 학습 데이터 시트 작성
- 편향 점검 (분기별)
- 보안 평가 (적대적 테스트)
- 운영 모니터링

## 5. 사고 대응
- AI 결정 분쟁 발생 시 절차
- 잘못된 결과 발견 시 보고 라인
- 사용자 이의제기 처리 절차

## 6. 교육·훈련
- 신규 입사자 AI 윤리 교육
- 정기 업데이트 교육
- 사고 사례 학습

## 7. 책임 소재
- AI 거버넌스 책임자: ...
- 모델 카드 작성 책임자: ...
- 사고 대응 책임자: ...

10.2 Claude를 활용한 초안 작성

다음 정보를 바탕으로 우리 회사의 책임 있는 AI 사용 가이드라인 초안을 작성해 주세요.
한국 AI 기본법(2026), 개인정보보호법, OECD AI 원칙을 준수하는 형태여야 합니다.

[회사 정보]
- 업종: (예: 보안 컨설팅)
- 규모: (예: 50명)
- 주요 AI 활용: (예: 보고서 작성 보조, 코드 분석, 위협 인텔리전스)
- 처리 데이터: (예: 고객 시스템 정보, 모의해킹 결과)

[가이드라인에 반드시 포함되어야 할 항목]
- AI 도구 사용 시 입력 금지 데이터 목록
- 결과물 사용 시 사람 검토 절차
- AI 사용 사실 명시 의무
- 사고 발생 시 보고 라인
- 분기별 검토 절차

10.3 검토 체크리스트

LLM이 만든 초안은 반드시 다음 항목을 검증합니다.

항목점검 내용
법령 정확성인용된 조항 번호가 실제와 일치하는가
회사 환경 적합성일반론이 아니라 우리 회사 실제 활동에 맞는가
실현 가능성명시된 절차가 실제로 운영 가능한 수준인가
책임 명확성책임자·역할이 빠짐없이 지정되어 있는가
갱신 절차기술·법 변화에 따른 업데이트 절차가 있는가

11. 글로벌 윤리 사례 학습

이론을 마지막으로 한 번 더 굳히기 위해, 글로벌 사례 세 가지를 봅니다.

11.1 Microsoft Tay (2016)

마이크로소프트가 트위터에 공개한 AI 챗봇 Tay는, 출시 16시간 만에 인종차별·반사회적 발언을 학습해 서비스가 중단되었습니다.

무엇이 문제였나윤리 원칙 위반
사용자 입력으로 실시간 학습하는 구조견고성·안전성
적대적 입력에 대한 대응 부재견고성
사용자에 대한 영향 평가 부족책임성
출시 전 적대적 테스트 부족안전성

이 사고 이후 글로벌 AI 사업자들은 Red Team(의도적 적대 테스트팀)을 운영하는 것이 표준이 되었습니다.

11.2 COMPAS 양형 보조 시스템 (2016 ProPublica 보도)

미국 일부 주에서 사용된 재범 예측 AI인 COMPAS는, 흑인 피고에게 더 높은 재범률을 부여하는 편향이 ProPublica 분석으로 드러났습니다.

무엇이 문제였나윤리 원칙 위반
학습 데이터에 사회적 편향 반영공정성
의사결정 근거 비공개(영업비밀)투명성
영향받는 피고에게 이의제기 절차 부족책임성

이 사례는 고위험 영역 AI에 대한 외부 감사가 필요하다는 논의의 기폭제가 되었습니다. 한국 AI 기본법 제27조의 설명 가능성 의무도 이 흐름의 영향을 받았습니다.

11.3 Apple Card 신용한도 차별 (2019)

Apple Card가 같은 가구의 부부에게 남편에게 더 높은 신용한도를 부여한 사례가 SNS에서 화제가 되었습니다. 골드만삭스의 알고리즘이 성별 편향을 가졌다는 의심이 제기되었고, 뉴욕주 금융감독국 조사로 이어졌습니다.

무엇이 문제였나윤리 원칙 위반
알고리즘의 의사결정 근거 미설명투명성
사용자 이의제기 절차 부족책임성
학습 데이터 편향 점검 부족공정성

조사 결과 직접적인 차별은 없었지만, 설명할 수 없는 시스템은 차별 의심을 해명할 수도 없다는 교훈을 남겼습니다.