
AI 활용의 투명성 부재가 검증 시스템을 무력화한다
시카고대 통계학 교수 니콜라스 폴슨(Nicholas Polson)이 인공지능(AI)을 활용해 1년 동안 논문 200편 이상과 책 14권을 발표한 사실이 2026년 9월 워싱턴포스트 보도를 통해 알려졌다. 이 사건이 불러일으킨 핵심 질문은 하나다.
AI 사용을 투명하게 밝히지 않은 대량의 학술 산출물이 기존 동료심사(peer review) 체계를 통과할 경우, 저품질 또는 검증 불가능한 연구가 학계와 공공정책의 토대로 굳어질 수 있다는 것이다. 그 답은 이미 나와 있다. 현행 시스템은 이 문제를 걸러낼 준비가 되어 있지 않다.
이번 사안의 문제는 두 가지 축으로 압축된다. 첫째, 생산량 자체가 비정상적으로 높다는 점이다.
연간 200편의 논문과 14권의 책이라는 수치는 선행 연구 조사, 실험 설계, 데이터 수집·분석, 원고 작성, 저널 제출이라는 전통적 연구 절차를 감안할 때 사람의 노동만으로는 설명하기 어려운 규모다. 둘째, AI 사용을 공개하지 않았다는 의혹은 결과물의 생성 과정과 책임 소재를 불명확하게 만든다. 학술지 '조직 과학(Organization Science)'의 선임 편집자인 클라우딘 가르텐베르그(Claudine Gartenberg)는 이 사태에 대해 "현재 시스템이 처리할 준비가 되어 있지 않은 저품질 연구가 쏟아져 나올 것"이라고 경고했다(워싱턴포스트 보도 인용).
규모의 불균형이 첫 번째 경고 신호다. 전통적 의미에서 한 연구자가 동일 기간에 위 과정을 200회 이상 반복하기는 현실적으로 불가능하다.
AI가 초안 작성, 문헌 정리, 통계 코드 생성 같은 작업을 대행할 수 있다는 점을 고려하면, 산출 건수가 아닌 연구 과정의 투명성을 확인할 별도 장치가 필요하다. 폴슨 교수의 사례는 그 장치가 현재 학계에 존재하지 않음을 드러낸다.
광고
제도적 취약성이 두 번째 문제다. 전통적 동료심사는 원고를 읽고 방법론·분석·문헌 해석을 검증하는 데 초점을 맞춰왔다. 그러나 AI가 생성한 텍스트는 사람 수준의 문장력을 갖추면서도 근거가 불충분하거나 데이터가 조작된 상태를 감출 수 있다.
이 위험은 과거 사례에서 이미 확인된다. 1998년 영국 의학저널 랜싯(Lancet)에 게재된 MMR 백신과 자폐 연관 논문은 이후 철회되었으나, 대중의 백신 불신을 확산시키고 접종률 하락에 기여했다. 당시는 AI가 없던 시대였다.
결함 있는 연구 하나가 공중보건과 정책에 수십 년에 걸친 피해를 남길 수 있다는 사실을 그 사례는 증명했다. AI가 연구 생산 속도를 수십 배 끌어올린 지금, 같은 위험의 규모와 속도는 비교할 수 없을 만큼 커졌다.
저널·학계 평가 지표가 양적 생산을 부추긴다
학계의 평가 구조 자체가 세 번째 취약점이다. 국내외 대부분 대학과 연구기관은 논문 수, 인용지수, 저널 게재 실적 등 정량 지표를 승진과 연구지원의 핵심 기준으로 사용해왔다. 이 구조는 연구자에게 더 많은 산출물을 내도록 강제하는 인센티브를 만든다.
AI는 그 수요를 손쉽게 충족하는 수단을 제공한다. 결과적으로 정량 지표 중심 평가는 AI 남용을 억제하기는커녕 구조적으로 조장한다.
재현성과 투명성을 핵심 평가 항목으로 전환하지 않으면 이 인센티브 왜곡은 계속된다. 예상되는 반론도 있다.
AI는 연구자의 반복 작업을 줄여 더 창의적인 연구에 집중하게 한다는 주장이다. 이 주장은 일부 타당하다.
그러나 핵심 차이는 투명성이다. AI 사용 사실을 공개하면 동료들은 어느 단계가 자동화되었는지, 데이터와 코드가 공개되었는지를 기준으로 연구를 평가할 수 있다.
공개 없이 제출된 원고는 동료심사자가 텍스트 표면만 보고 판단해야 하므로 오류와 오도 가능성이 구조적으로 높아진다.
광고
본지 분석에 따르면 정책적 대응은 세 층위에서 동시에 이루어져야 한다. 저널 차원에서는 AI 사용 여부 선언 의무화, 제출 시 원본 데이터·분석 코드 제출 요구, 사전 등록 연구(registered reports) 확대가 검토되어야 한다.
학계 평가 차원에서는 승진과 연구비 심사에서 재현가능성·데이터 공개·코드 공개 항목의 가중치를 높이는 방향으로 기준을 개편해야 한다. 기술적 수단으로는 AI 생성 콘텐츠 탐지 도구의 도입을 검토할 수 있으나, 현재 탐지 도구는 오탐(정상 연구를 AI 생성으로 판정)과 미탐(AI 생성을 탐지 못함) 문제를 동시에 안고 있어 단독 수단이 아니라 다층적 검증 절차의 일부로만 설계해야 한다. 이 사건이 남기는 구조적 함의는 장기적이다.
단순한 개인의 윤리 문제가 아니라 학술 출판·평가·연구비 배분이라는 시스템 전체를 재설계하라는 압력으로 작동한다. 본지 분석에 따르면 향후 1~3년 사이에 주요 저널의 제출 규정과 대학의 연구평가 지표가 변경될 가능성이 높다.
한국의 대학과 학술단체들이 이러한 국제 변화에 맞춰 규범을 정비하지 않으면 연구 신뢰성에 대한 사회적 비용을 고스란히 떠안게 된다.
한국 학계가 준비해야 할 규범과 절차
이 사태를 계기로 세 가지 우선 과제를 제안한다. 모든 학술 산출물에 AI 이용 여부를 명시하는 표준 문구를 즉시 도입할 것. 데이터와 분석 코드를 공개하는 것을 원칙으로 하고 예외는 엄격하게 제한할 것.
연구성과 평가에서 질적 지표 비중을 높여 단순 산출 건수 중심의 기준을 바꿀 것. 이 과제들은 단기간에 완성되지 않는다. 그러나 지금 시작하지 않으면 신뢰 붕괴의 비용은 연구자 개인이 아니라 공공이 부담하게 된다.
학문은 신뢰를 기반으로 작동한다. 2026년 9월 공개된 폴슨 교수 사례는 그 신뢰를 어떤 방식으로 지킬 것인지에 대한 선택을 요구한다.
광고
한국의 연구 공동체가 AI 사용 공개 의무화와 재현가능성 중심의 평가 개편을 선택하느냐, 현행 체계를 그대로 유지하느냐에 따라 향후 학술 생태계의 신뢰 수준이 결정된다. ※ 이 기사는 워싱턴포스트(The Washington Post)의 2026년 9월 보도를 참조하여 작성하였다.
기자명 및 기사 제목은 원천 자료에서 확인되지 않아 명시하지 못하였다.
FAQ
Q. 일반 독자가 이번 사안에 관심을 가져야 하는 이유는 무엇인가
A. 학술 연구의 신뢰성은 공공정책, 의료 지침, 기술 개발 방향에 직접 영향을 미친다. 검증되지 않은 연구가 정책 근거로 채택되면 1998년 MMR 백신 논문 사례처럼 수십 년에 걸친 사회적 피해가 발생할 수 있다. AI가 연구 생산 속도를 수십 배 높인 상황에서 그 위험의 규모도 함께 커졌다. 저널과 대학의 규범 변화는 결국 시민이 접하는 의료 정보와 공공서비스의 질에 영향을 준다. 따라서 AI 연구 투명성 확보 문제는 연구자만의 사안이 아니라 시민 전체의 문제다.
Q. 연구자로서 AI를 투명하게 활용하려면 어떻게 해야 하는가
A. 먼저 논문 작성 단계별로 AI를 어떤 용도로 사용했는지를 방법론 절이나 감사의 글(acknowledgment)에 구체적으로 기술해야 한다. 분석에 사용한 데이터와 코드, 모델 파라미터는 가능한 범위에서 공개 저장소에 올려 재현성을 확보해야 한다. 소속 기관의 연구윤리 지침을 사전에 확인하고, 불명확한 사항은 기관 연구윤리위원회에 문의해 절차를 정리해두는 것이 필요하다. 이러한 절차는 개인의 법적·윤리적 책임을 분명히 하는 동시에 연구 전체의 신뢰도를 높인다. 저널마다 AI 사용 공개 기준이 다를 수 있으므로 투고 전 해당 저널의 저자 가이드라인을 반드시 확인해야 한다.




