Skip to content

Latest commit

 

History

7 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 

Repository files navigation

Korean AI Overview activation dataset — README

한국어 검색어에 대한 AI 검색 요약 활성화 여부와 활성화 요인 3개의 라벨(문법적 형태, 검색 의도, 주제)과 LLM의 해당 라벨 판정 확신도를 담은 데이터셋입니다.

파일

  • KoAIO.csv — 배포용 최종 데이터셋 고유 검색어 합계 11,638건, 총 23,276행(검색어 × 2엔진)

데이터 구성 (3개 소스)

고유 검색어 11,638건

ORCAS      ████████████████        3,265  (28.1%)
AIO        ████████████████████    4,022  (34.6%)
Naver_Kin  ██████████████████████  4,351  (37.4%)
출처 설명 고유 검색어 행 수(구글+네이버 쌍)
ORCAS ORCAS 검색로그에서 샘플링, 한국어로 번역 3,265 6,530
AIO 공개 벤치마크(ELI5/NQ/Debate/Amazon Retail/ORCAS 등 하위 subset), 한국어로 번역 4,022 8,044
Naver_Kin 네이버 지식iN 질문 제목, 원문 대신 docId/url로 배포 4,351 8,702

데이터셋 컬럼

컬럼 타입 설명
데이터 출처 ORCAS/AIO/Naver_Kin 검색어 출처
AIO_Benchmark 하위출처 문자열, AIO에만 해당 AIO 소스 내 세부 벤치마크명 (8종). 아래 "AIO Benchmark 하위출처" 절 참조
검색어 한국어 텍스트, ORCAS/AIO에만 해당 GPT-5.6 Terra로 번역한 검색어
지식인_doc_id 문자열, Naver_Kin에만 해당 네이버 지식iN 게시물 고유 ID
지식인_url URL, Naver_Kin에만 해당 위 게시물의 원문 링크
검색엔진 google/naver 어느 엔진에서 측정했는지
AI 검색 요약 활성화 여부 True/False 해당 검색엔진이 이 검색어에 AI 검색 요약을 노출했는지
문법적 형태 범주형(10종) 문법적 형태 (명사구/의문문/평서문 등)
검색 의도 범주형(5종) 검색 의도 (이동형/거래형/상업형/정보형/분류 불가).
주제 범주형(20종) Google Trends 19개 카테고리(기타 포함) + 분류불가 = 총 20 카테고리 기준 주제 분류
LLM 확신도 high/medium/low 위 3개 라벨(문법적 형태/검색 의도/주제)에 대한 LLM 자체 확신도

AIO Benchmark 하위출처

데이터 출처 = AIO인 4,022건은 성격이 다른 8개 하위 집합으로 구성됩니다.

하위출처 설명 고유 검색어 비중
ORCAS Bing 실사용 검색어 1,836 45.6%
Debate 논쟁형 검색어 593 14.7%
ELI5 Reddit 기반 복합 정보형 질문 548 13.6%
NQ 구글 검색에 입력된 실사용 질문형 검색어 287 7.1%
NQ keywords NQ를 키워드형으로 변형 266 6.6%
Amazon Retail 실제 상품 키워드 검색어 205 5.1%
Amazon Retail Q 위 상품에 대한 질문형 145 3.6%
Amazon Retail Comp 위 상품의 비교형 142 3.5%
합계 4,022 100%

대응쌍 안내. NQNQ keywords, Amazon RetailAmazon Retail QAmazon Retail Comp는 검색어의 핵심 내용을 고정하고 문법적 형태만 바꾼 대응쌍입니다. 주제 차이에 의한 교란 없이 형태 효과만 분리해 분석할 때 활용할 수 있습니다.

AIO_Benchmark 하위출처 = "ORCAS"는 최상위 데이터 출처 = "ORCAS"와 다른 그룹입니다. AIO Benchmark 내부에 포함된 ORCAS 유래 서브셋을 가리키며, 두 그룹 간 중복 검색어는 이미 제거되었습니다.

문법적 형태 범주

국어 문법의 문장 종결법을 기준으로 명사구·비종결·종결의 3계층을 설정하고, 각 계층을 하위 범주로 나누어 총 9개 범주와 분류 불가로 구성했습니다. 판정은 검색어 말단의 어미를 기준으로 합니다. 종결어미가 있으면 서법에 따라 종결 계층, 연결어미·명사형 전성어미·관형형 전성어미가 있으면 비종결 계층, 어미가 실현되지 않은 체언구이면 명사구 계층으로 분류합니다. 단 명사형 전성어미 -(으)ㅁ은 문장을 끝맺는 기능을 하므로 후행 성분이 없을 때에 한하여 평서문으로 판정했습니다.

계층 형태 예시 고유 검색어 비중
명사구 명사구 시험 점수 5,490 47.2%
명사구 조사 결합 명사구 UFC의 역사 712 6.1%
명사구 관형절 포함 명사구 감염된 손톱 754 6.5%
비종결 연결어미 파편 피임약 먹으면 128 1.1%
비종결 관형형 파편 혀가 묶인 8 0.1%
비종결 명사형 전성어미 타이핑 배우기 212 1.8%
종결 의문문 토끼는 설치류인가 3,380 29.0%
종결 평서문 전화기 충전 안됨 550 4.7%
종결 명령·요청문 웹툰 찾아주세요 391 3.4%
분류 불가 ㅁㄴㅇㄹ 13 0.1%

계층 단위로 묶으면 명사구 6,956건(59.8%), 종결 4,321건(37.1%), 비종결 348건(3.0%)입니다.

검색 의도 범주

범주 설명 고유 검색어 비중
정보형 개념, 사실 확인 8,374 72.0%
상업형 제품 비교, 후기 탐색 1,602 13.8%
거래형 다운로드, 계산 등 기능 수행 921 7.9%
이동형 특정 사이트 접속 184 1.6%
분류 불가 557 4.8%

주제 범주

Google Trends 카테고리 체계를 그대로 사용했습니다. 기타는 Trends 자체 카테고리(Other)이며, 주제를 알 수 없는 경우만 분류 불가로 별도 구분했습니다. 따라서 실질 주제 18개 + 기타 + 분류 불가 = 20종입니다.

주제 고유 검색어 비중
건강 1,915 16.5%
기술 1,651 14.2%
법률, 행정 1,029 8.8%
엔터테인먼트 980 8.4%
기타 820 7.0%
직업, 교육 786 6.8%
과학 780 6.7%
비즈니스, 금융 512 4.4%
뷰티, 패션 443 3.8%
쇼핑 425 3.7%
음식 407 3.5%
여행, 교통 347 3.0%
게임 283 2.4%
스포츠 227 2.0%
분류 불가 213 1.8%
자동차 211 1.8%
정치 205 1.8%
취미, 여가 202 1.7%
반려동물 141 1.2%
기후, 날씨 61 0.5%

라벨링 방법

  • 모델: openai/gpt-5.6-terra (OpenRouter)
  • 문법적 형태, 검색 의도, 주제 3개의 활성화 요인을 하나의 구조화 출력(JSON schema)으로 동시 라벨링
  • LLM 확신도는 LLM이 자체 판단한 확신도이며, 직접 검토(100건, 평가자 2인) 대조 결과:
    • 검색 의도: high 신뢰도군이 medium 대비 사람과의 일치율이 약 25%p 높음
    • 주제: high가 medium 대비 약 11.5%p 높음
    • 문법적 형태: high/medium 간 차이 거의 없음

필터링 파이프라인 (원본 검색어 → 최종 배포본)

  1. 원본 수집 검색어: 33,379건
  2. 한국어 번역 가능성 판정(LLM 기반 보수적 필터) — 표현이 부자연스럽거나(BROKEN_GRAMMAR 등) 한국 맥락에 무관한(LOCALE, FOREIGN_SERVICE 등) 검색어 제외
  3. AI 검색 요약 활성화 여부 측정 (Google/Naver 각각 크롤)
  4. LLM 통해 문법적 형태 / 검색 의도 / 주제에 대한 라벨링
  5. 최종 배포본: 고유 검색어 11,638건 / 23,276행

수집 방법

AI 검색 요약 활성화는 엔진 정책에 따라 시점별로 변동합니다. 본 데이터는 아래 시점의 스냅샷이며, 현재 재측정 시 다른 결과가 나올 수 있습니다.

항목 내용
수집 시기 2026년 8월 (약 1개월)
도구 Playwright 기반 크롤러
세션 쿠키 기록이 없는 비로그인 상태
지역·언어 지역 = 한국, 언어 = 한국어
판정 기준 구글 'AI 개요' / 네이버 'AI 브리핑'의 노출 유무
차단 대응 캡차는 우회하지 않고 요청 속도 제어와 브라우저 프로필 분산으로 대응

주의사항

  • 자동화 요청이 차단된 경우 활성화율이 실제보다 낮게 측정되었을 수 있습니다.
  • 구글 활성화율이 90.9%로 상한에 가까워 구글 데이터만으로는 요인별 구분력이 낮습니다. 요인 분석은 네이버 기준을 권장합니다.
  • 고유 검색어 20건 미만 범주(관형형 파편 8건, 형태 분류 불가 13건)는 통계 추정이 불안정합니다.
  • ORCAS는 미국 영어권 사용자의 클릭 로그이므로, 번역 후에도 한국 사용자의 실제 검색 분포와는 차이가 있을 수 있습니다.
  • 본 데이터셋은 활성화 여부만 기록하며, 요약문의 내용·품질·출처는 포함하지 않습니다.
  • 엔진의 내부 판정 근거는 관측할 수 없으므로, 모든 결과는 관측된 상관관계이며 인과로 해석할 수 없습니다.

라이선스

본 데이터셋은 비영리 학술 연구 목적으로만 사용할 수 있습니다.

구성 원 출처 조건
ORCAS 유래 검색어
데이터 출처=ORCAS
AIO_Benchmark 하위출처=ORCAS
MS MARCO / ORCAS
(Craswell et al., 2020)
비영리 연구 목적 한정. 별도의 라이선스나 지식재산권을 부여하지 않음. 파생물에도 동일 조건 적용
그 외 AIO Benchmark 유래
(ELI5 / NQ / NQ keywords / Debate / Amazon Retail 3종)
rag24/AIO
(Grossman et al., SIGIR 2026)
Apache-2.0 (재배포 저장소 기준)
Naver_Kin 네이버 지식iN 게시물 본문 미재배포, docId/url만 제공. 네이버 이용약관 준수
AI 검색 요약 활성화 결과 및 3축 라벨 본 연구 CC BY-NC 4.0

AIO Benchmark는 여러 공개 데이터셋을 결합한 벤치마크이며, 본 데이터셋은 해당 저장소가 Apache-2.0으로 배포한 검색어를 번역하여 사용했습니다. 서브셋별 원 출처의 조건이 별도로 적용될 수 있으며, 특히 NQ / NQ keywords의 원 출처인 Natural Questions는 CC BY-SA 3.0으로, 해당 행의 2차적 저작물에는 동일조건 변경허락이 적용됩니다.

비영리 조건이 적용되는 행은 데이터 출처 = "ORCAS" 또는 AIO_Benchmark 하위출처 = "ORCAS"로 식별할 수 있습니다.

인용

본 데이터셋 사용 시 아래를 인용해 주십시오.

@inproceedings{lee2026koaio,
  title     = {대규모 한국어 검색어 데이터셋 KoAIO 구축을 통한 AI 검색 요약 활성화 경향 분석},
  author    = {이정찬 and 남궁혁 and 강현석 and 정상근},
  booktitle = {제38회 한글 및 한국어 정보처리 학술대회 논문집},
  year      = {2026}
}

아래 원 출처의 인용은 라이선스상 의무입니다.

  • ORCAS — N. Craswell, D. Campos, B. Mitra, E. Yilmaz, and B. Billerbeck, "ORCAS: 18 million clicked query-document pairs for analyzing search," Proc. of CIKM, pp. 2983–2989, 2020.
  • AIO Benchmark — R. Grossman, S. Liu, M. K. Chen et al., "How generative AI disrupts search: An empirical study of Google search, Gemini, and AI overviews," Proc. of SIGIR, 2026.

NQ / NQ keywords 서브셋을 사용하는 경우 Natural Questions(Kwiatkowski et al., TACL 7:453–466, 2019)의 출처 표시가 추가로 요구됩니다.

개인정보/저작권 관련 처리

  • Naver_Kin은 검색어 원문 대신 docId/url만 배포 — 게시물 텍스트를 직접 재배포하지 않음
  • 수집 단계에서 민감 검색어를 직접 검토하여 제거

About

Korean search query dataset for AI search summary (AI Overview) activation analysis — 11,638 queries measured on Naver and Google

Topics

Resources

Stars

1 star

Watchers

0 watching

Forks

Releases

Packages

Contributors