DeepFake Check
블로그로 돌아가기
DeepCheckAI Team 4분 소요

딥페이크 벤치마크 결과를 읽는 법: 알 수 있는 것과 없는 것

벤치마크가 답하도록 설계된 질문부터 확인합니다

벤치마크 결과만 보면 곧바로 결론을 내리고 싶어집니다. 한 시스템의 점수가 더 높으니 어떤 이미지나 영상이 가짜인지도 더 잘 판단할 것이라고 생각하기 쉽습니다. 하지만 벤치마크는 정해진 평가 안에서 시스템을 측정합니다. 결과를 사용하기 전에 평가가 시스템에 어떤 작업을 요구했는지부터 확인해야 합니다.

NIST는 Open Media Forensics Challenge Evaluation, 즉 OpenMFC를 미디어 포렌식 알고리즘과 시스템의 역량을 평가하고 측정하는 공개 평가 시리즈로 설명합니다. 공개 페이지가 밝힌 중심 과제는 이미지와 영상의 자동 조작 탐지 및 위치 확인입니다. 미디어가 조작됐는지 판단하고, 해당되는 경우 조작된 영역과 유형을 찾는 작업이 포함됩니다. GAN 조작 탐지 과제도 지원합니다.

이 설명은 평가 대상을 정해 줍니다. 모든 탐지기와 모든 조작 방식, 사용자가 만나는 모든 파일에 적용되는 보편적 정확도를 제시하지는 않습니다. 따라서 먼저 물어야 할 것은 이 평가가 어떤 역량을 어떤 과제로 측정했는지입니다.

점수보다 과제 범위를 먼저 읽습니다

과제 이름과 출력부터 확인합니다. 조작 탐지, 조작 영역 확인, 조작 유형 식별은 서로 다른 질문에 답합니다. 한 과제의 결과를 다른 과제의 근거로 바꾸면 안 됩니다. 표나 순위표가 과제별로 나뉘어 있다면 검토 기록에서도 그대로 구분합니다.

그다음 평가를 정의하는 자료를 찾습니다. NIST는 OpenMFC가 벤치마크 데이터셋과 평가 인프라를 제공한다고 설명하며 프로그램 웹사이트를 안내합니다. NIST 공개 데이터셋은 웹사이트 가입과 라이선스 계약 완료 후 요청할 수 있다고도 밝힙니다. 읽고 있는 결과가 별도 문서를 가리킨다면 그 문서에서 데이터, 과제, 결과 표기의 범위를 확인합니다. 세부 내용을 볼 수 없다면 추정으로 채우지 말고 확인하지 못한 항목으로 남깁니다.

결과가 OpenMFC에 속하는지 이전 프로그램에 속하는지도 확인합니다. NIST는 OpenMFC가 DARPA MediFor 프로그램을 위해 개발된 Media Forensic Challenge 평가 경험을 바탕으로 한다고 설명합니다. 이름이 비슷해도 서로 다른 평가를 같은 것으로 취급할 수는 없습니다. 결과에 붙은 프로그램 이름을 그대로 기록합니다.

이 확인 순서는 본문이 제안하는 실무 절차입니다. NIST는 프로그램과 과제를 설명하지만, 이 글의 판단 절차를 제시하거나 벤치마크 결과가 개별 파일의 진위를 확정한다고 말하지 않습니다.

시스템 결과와 개별 파일 판단을 분리합니다

벤치마크 결과는 해당 평가에서 보고된 시스템 성능을 설명합니다. 개별 파일 검토는 다른 질문을 다룹니다. 이 이미지나 영상에 어떤 증거가 있으며 지금 어떤 조치가 타당한지를 따져야 합니다. 벤치마크 결과는 시스템에 관한 배경 자료로 보관하고, 개별 파일의 판정처럼 기록하지 않습니다.

의심스러운 파일을 검토할 때는 가능하면 원본을 보존하고 어디서 받았는지, 누가 제공했는지, 어떤 주장과 함께 유통됐는지 기록합니다. 신뢰할 수 있는 게시자나 원래 계정이 같은 자료와 맥락을 제공하는지 확인하고, 이용 가능한 출처 증명 정보도 살펴봅니다. 이 과정은 파일을 벤치마크의 특정 행에 억지로 맞추는 작업과 다릅니다.

탐지기를 사용했다면 결과를 파일과 다른 증거 옆에 보관합니다. 자동 탐지에는 오탐과 미탐이 있습니다. 진짜 자료가 의심스럽다고 표시될 수 있고, 조작된 자료를 놓칠 수도 있습니다. 높은 위험 신호는 추가 검토의 이유가 되지만 낮은 신호가 파일의 진위를 보증하지는 않습니다.

다른 사람이 반복할 수 있는 검토 기록을 만듭니다

인용하려는 벤치마크 주장마다 프로그램, 과제, 출처 URL, 논의하는 결과를 정확히 기록합니다. 자료를 확인한 날짜도 남깁니다. 직접 볼 수 없는 표나 문서에 결과가 의존한다면 그 한계를 적습니다. 범위가 짧고 분명한 기록이 확인할 수 없는 확신보다 유용합니다.

개별 미디어 검토는 별도 기록으로 관리합니다. 원본 또는 확보한 최선의 사본, 출처와 주변 주장, 이용 가능한 출처 증거, 탐지 결과, 최종 사람의 판단을 함께 둡니다. 두 기록을 분리하면 시스템 단위 결과가 한 파일의 증명으로 바뀌는 일을 막을 수 있습니다.

DeepFakeCheck는 저장된 이미지, 영상, 음성 또는 텍스트 파일을 분석해 확률적 위험 신호를 제공합니다. OpenMFC 평가를 재현하거나 파일 제공자의 신원을 확인하거나 화면 속 사건이 실제로 일어났음을 입증하지 않습니다. 결과는 파일 검토의 한 항목으로 사용하고 출처 확인을 대신하게 두지 않습니다.

최종 결정을 벤치마크에 맡기지 않습니다

비교 범위를 평가가 명시한 과제 안에 유지하면 벤치마크는 유용합니다. 어떤 과제가 평가됐는지 이해하고 보고된 결과의 근거 자료를 찾는 데 도움을 줍니다. 반대로 순위나 점수를 관계없는 파일, 과제, 조건에 대한 보증으로 사용하면 결과의 범위를 벗어납니다.

조치하기 전에 지금 가진 증거가 평가된 시스템에 관한 것인지 개별 파일에 관한 것인지 구분합니다. 시스템을 설명할 때는 정확한 프로그램과 과제를 인용합니다. 파일을 판단할 때는 출처, 맥락, 출처 증거, 탐지 결과를 기록합니다. 현재 증거가 필요한 결정을 뒷받침하지 못한다면 결론을 열어 두고 확인을 계속합니다.

적용할 경계는 분명합니다. 벤치마크는 도구 선택과 검토 계획에 참고할 수 있지만, 특정 파일에 관한 결정은 그 파일에서 확보한 증거에 따라야 합니다.

출처

  • NIST, Open Media Forensics Challenge Evaluation: https://www.nist.gov/itl/iad/mltg/open-media-forensics-challenge

혹시 AI가 만든 이미지인가요?

고정밀 딥페이크 탐지 도구로 이미지를 바로 분석해 보세요.

이미지 분석하기