한국어 검색어에 대한 AI 검색 요약 활성화 여부와 활성화 요인 3개의 라벨(문법적 형태, 검색 의도, 주제)과 LLM의 해당 라벨 판정 확신도를 담은 데이터셋입니다.
KoAIO.csv— 배포용 최종 데이터셋 고유 검색어 합계 11,638건, 총 23,276행(검색어 × 2엔진)
고유 검색어 11,638건
ORCAS ████████████████ 3,265 (28.1%)
AIO ████████████████████ 4,022 (34.6%)
Naver_Kin ██████████████████████ 4,351 (37.4%)
| 출처 | 설명 | 고유 검색어 | 행 수(구글+네이버 쌍) |
|---|---|---|---|
ORCAS |
ORCAS 검색로그에서 샘플링, 한국어로 번역 | 3,265 | 6,530 |
AIO |
공개 벤치마크(ELI5/NQ/Debate/Amazon Retail/ORCAS 등 하위 subset), 한국어로 번역 | 4,022 | 8,044 |
Naver_Kin |
네이버 지식iN 질문 제목, 원문 대신 docId/url로 배포 |
4,351 | 8,702 |
| 컬럼 | 타입 | 설명 |
|---|---|---|
데이터 출처 |
ORCAS/AIO/Naver_Kin |
검색어 출처 |
AIO_Benchmark 하위출처 |
문자열, AIO에만 해당 |
AIO 소스 내 세부 벤치마크명 (8종). 아래 "AIO Benchmark 하위출처" 절 참조 |
검색어 |
한국어 텍스트, ORCAS/AIO에만 해당 |
GPT-5.6 Terra로 번역한 검색어 |
지식인_doc_id |
문자열, Naver_Kin에만 해당 |
네이버 지식iN 게시물 고유 ID |
지식인_url |
URL, Naver_Kin에만 해당 |
위 게시물의 원문 링크 |
검색엔진 |
google/naver |
어느 엔진에서 측정했는지 |
AI 검색 요약 활성화 여부 |
True/False |
해당 검색엔진이 이 검색어에 AI 검색 요약을 노출했는지 |
문법적 형태 |
범주형(10종) | 문법적 형태 (명사구/의문문/평서문 등) |
검색 의도 |
범주형(5종) | 검색 의도 (이동형/거래형/상업형/정보형/분류 불가). |
주제 |
범주형(20종) | Google Trends 19개 카테고리(기타 포함) + 분류불가 = 총 20 카테고리 기준 주제 분류 |
LLM 확신도 |
high/medium/low |
위 3개 라벨(문법적 형태/검색 의도/주제)에 대한 LLM 자체 확신도 |
데이터 출처 = AIO인 4,022건은 성격이 다른 8개 하위 집합으로 구성됩니다.
| 하위출처 | 설명 | 고유 검색어 | 비중 |
|---|---|---|---|
ORCAS |
Bing 실사용 검색어 | 1,836 | 45.6% |
Debate |
논쟁형 검색어 | 593 | 14.7% |
ELI5 |
Reddit 기반 복합 정보형 질문 | 548 | 13.6% |
NQ |
구글 검색에 입력된 실사용 질문형 검색어 | 287 | 7.1% |
NQ keywords |
위 NQ를 키워드형으로 변형 |
266 | 6.6% |
Amazon Retail |
실제 상품 키워드 검색어 | 205 | 5.1% |
Amazon Retail Q |
위 상품에 대한 질문형 | 145 | 3.6% |
Amazon Retail Comp |
위 상품의 비교형 | 142 | 3.5% |
| 합계 | 4,022 | 100% |
대응쌍 안내. NQ ↔ NQ keywords, Amazon Retail ↔ Amazon Retail Q ↔ Amazon Retail Comp는 검색어의 핵심 내용을 고정하고 문법적 형태만 바꾼 대응쌍입니다. 주제 차이에 의한 교란 없이 형태 효과만 분리해 분석할 때 활용할 수 있습니다.
AIO_Benchmark 하위출처 = "ORCAS"는 최상위 데이터 출처 = "ORCAS"와 다른 그룹입니다. AIO Benchmark 내부에 포함된 ORCAS 유래 서브셋을 가리키며, 두 그룹 간 중복 검색어는 이미 제거되었습니다.
국어 문법의 문장 종결법을 기준으로 명사구·비종결·종결의 3계층을 설정하고, 각 계층을 하위 범주로 나누어 총 9개 범주와 분류 불가로 구성했습니다. 판정은 검색어 말단의 어미를 기준으로 합니다. 종결어미가 있으면 서법에 따라 종결 계층, 연결어미·명사형 전성어미·관형형 전성어미가 있으면 비종결 계층, 어미가 실현되지 않은 체언구이면 명사구 계층으로 분류합니다. 단 명사형 전성어미 -(으)ㅁ은 문장을 끝맺는 기능을 하므로 후행 성분이 없을 때에 한하여 평서문으로 판정했습니다.
| 계층 | 형태 | 예시 | 고유 검색어 | 비중 |
|---|---|---|---|---|
| 명사구 | 명사구 | 시험 점수 | 5,490 | 47.2% |
| 명사구 | 조사 결합 명사구 | UFC의 역사 | 712 | 6.1% |
| 명사구 | 관형절 포함 명사구 | 감염된 손톱 | 754 | 6.5% |
| 비종결 | 연결어미 파편 | 피임약 먹으면 | 128 | 1.1% |
| 비종결 | 관형형 파편 | 혀가 묶인 | 8 | 0.1% |
| 비종결 | 명사형 전성어미 | 타이핑 배우기 | 212 | 1.8% |
| 종결 | 의문문 | 토끼는 설치류인가 | 3,380 | 29.0% |
| 종결 | 평서문 | 전화기 충전 안됨 | 550 | 4.7% |
| 종결 | 명령·요청문 | 웹툰 찾아주세요 | 391 | 3.4% |
| — | 분류 불가 | ㅁㄴㅇㄹ | 13 | 0.1% |
계층 단위로 묶으면 명사구 6,956건(59.8%), 종결 4,321건(37.1%), 비종결 348건(3.0%)입니다.
| 범주 | 설명 | 고유 검색어 | 비중 |
|---|---|---|---|
| 정보형 | 개념, 사실 확인 | 8,374 | 72.0% |
| 상업형 | 제품 비교, 후기 탐색 | 1,602 | 13.8% |
| 거래형 | 다운로드, 계산 등 기능 수행 | 921 | 7.9% |
| 이동형 | 특정 사이트 접속 | 184 | 1.6% |
| 분류 불가 | — | 557 | 4.8% |
Google Trends 카테고리 체계를 그대로 사용했습니다. 기타는 Trends 자체 카테고리(Other)이며, 주제를 알 수 없는 경우만 분류 불가로 별도 구분했습니다. 따라서 실질 주제 18개 + 기타 + 분류 불가 = 20종입니다.
| 주제 | 고유 검색어 | 비중 |
|---|---|---|
| 건강 | 1,915 | 16.5% |
| 기술 | 1,651 | 14.2% |
| 법률, 행정 | 1,029 | 8.8% |
| 엔터테인먼트 | 980 | 8.4% |
| 기타 | 820 | 7.0% |
| 직업, 교육 | 786 | 6.8% |
| 과학 | 780 | 6.7% |
| 비즈니스, 금융 | 512 | 4.4% |
| 뷰티, 패션 | 443 | 3.8% |
| 쇼핑 | 425 | 3.7% |
| 음식 | 407 | 3.5% |
| 여행, 교통 | 347 | 3.0% |
| 게임 | 283 | 2.4% |
| 스포츠 | 227 | 2.0% |
| 분류 불가 | 213 | 1.8% |
| 자동차 | 211 | 1.8% |
| 정치 | 205 | 1.8% |
| 취미, 여가 | 202 | 1.7% |
| 반려동물 | 141 | 1.2% |
| 기후, 날씨 | 61 | 0.5% |
- 모델:
openai/gpt-5.6-terra(OpenRouter) - 문법적 형태, 검색 의도, 주제 3개의 활성화 요인을 하나의 구조화 출력(JSON schema)으로 동시 라벨링
LLM 확신도는 LLM이 자체 판단한 확신도이며, 직접 검토(100건, 평가자 2인) 대조 결과:검색 의도: high 신뢰도군이 medium 대비 사람과의 일치율이 약 25%p 높음주제: high가 medium 대비 약 11.5%p 높음문법적 형태: high/medium 간 차이 거의 없음
- 원본 수집 검색어: 33,379건
- 한국어 번역 가능성 판정(LLM 기반 보수적 필터) — 표현이 부자연스럽거나(BROKEN_GRAMMAR 등) 한국 맥락에 무관한(LOCALE, FOREIGN_SERVICE 등) 검색어 제외
- AI 검색 요약 활성화 여부 측정 (Google/Naver 각각 크롤)
- LLM 통해 문법적 형태 / 검색 의도 / 주제에 대한 라벨링
- 최종 배포본: 고유 검색어 11,638건 / 23,276행
AI 검색 요약 활성화는 엔진 정책에 따라 시점별로 변동합니다. 본 데이터는 아래 시점의 스냅샷이며, 현재 재측정 시 다른 결과가 나올 수 있습니다.
| 항목 | 내용 |
|---|---|
| 수집 시기 | 2026년 8월 (약 1개월) |
| 도구 | Playwright 기반 크롤러 |
| 세션 | 쿠키 기록이 없는 비로그인 상태 |
| 지역·언어 | 지역 = 한국, 언어 = 한국어 |
| 판정 기준 | 구글 'AI 개요' / 네이버 'AI 브리핑'의 노출 유무 |
| 차단 대응 | 캡차는 우회하지 않고 요청 속도 제어와 브라우저 프로필 분산으로 대응 |
- 자동화 요청이 차단된 경우 활성화율이 실제보다 낮게 측정되었을 수 있습니다.
- 구글 활성화율이 90.9%로 상한에 가까워 구글 데이터만으로는 요인별 구분력이 낮습니다. 요인 분석은 네이버 기준을 권장합니다.
- 고유 검색어 20건 미만 범주(
관형형 파편8건, 형태분류 불가13건)는 통계 추정이 불안정합니다. ORCAS는 미국 영어권 사용자의 클릭 로그이므로, 번역 후에도 한국 사용자의 실제 검색 분포와는 차이가 있을 수 있습니다.- 본 데이터셋은 활성화 여부만 기록하며, 요약문의 내용·품질·출처는 포함하지 않습니다.
- 엔진의 내부 판정 근거는 관측할 수 없으므로, 모든 결과는 관측된 상관관계이며 인과로 해석할 수 없습니다.
본 데이터셋은 비영리 학술 연구 목적으로만 사용할 수 있습니다.
| 구성 | 원 출처 | 조건 |
|---|---|---|
ORCAS 유래 검색어데이터 출처=ORCASAIO_Benchmark 하위출처=ORCAS |
MS MARCO / ORCAS (Craswell et al., 2020) |
비영리 연구 목적 한정. 별도의 라이선스나 지식재산권을 부여하지 않음. 파생물에도 동일 조건 적용 |
| 그 외 AIO Benchmark 유래 ( ELI5 / NQ / NQ keywords / Debate / Amazon Retail 3종) |
rag24/AIO (Grossman et al., SIGIR 2026) |
Apache-2.0 (재배포 저장소 기준) |
Naver_Kin |
네이버 지식iN | 게시물 본문 미재배포, docId/url만 제공. 네이버 이용약관 준수 |
| AI 검색 요약 활성화 결과 및 3축 라벨 | 본 연구 | CC BY-NC 4.0 |
AIO Benchmark는 여러 공개 데이터셋을 결합한 벤치마크이며, 본 데이터셋은 해당
저장소가 Apache-2.0으로 배포한 검색어를 번역하여 사용했습니다. 서브셋별 원
출처의 조건이 별도로 적용될 수 있으며, 특히 NQ / NQ keywords의 원 출처인
Natural Questions는 CC BY-SA 3.0으로, 해당 행의 2차적 저작물에는 동일조건
변경허락이 적용됩니다.
비영리 조건이 적용되는 행은 데이터 출처 = "ORCAS" 또는 AIO_Benchmark 하위출처 = "ORCAS"로 식별할 수 있습니다.
본 데이터셋 사용 시 아래를 인용해 주십시오.
@inproceedings{lee2026koaio,
title = {대규모 한국어 검색어 데이터셋 KoAIO 구축을 통한 AI 검색 요약 활성화 경향 분석},
author = {이정찬 and 남궁혁 and 강현석 and 정상근},
booktitle = {제38회 한글 및 한국어 정보처리 학술대회 논문집},
year = {2026}
}아래 원 출처의 인용은 라이선스상 의무입니다.
- ORCAS — N. Craswell, D. Campos, B. Mitra, E. Yilmaz, and B. Billerbeck, "ORCAS: 18 million clicked query-document pairs for analyzing search," Proc. of CIKM, pp. 2983–2989, 2020.
- AIO Benchmark — R. Grossman, S. Liu, M. K. Chen et al., "How generative AI disrupts search: An empirical study of Google search, Gemini, and AI overviews," Proc. of SIGIR, 2026.
NQ / NQ keywords 서브셋을 사용하는 경우 Natural Questions(Kwiatkowski et
al., TACL 7:453–466, 2019)의 출처 표시가 추가로 요구됩니다.
Naver_Kin은 검색어 원문 대신docId/url만 배포 — 게시물 텍스트를 직접 재배포하지 않음- 수집 단계에서 민감 검색어를 직접 검토하여 제거