컬렉션 설정¶
1. 메뉴 개요¶
컬렉션은 검색할 데이터를 묶어 둔 단위입니다.
이 화면에서 데이터를 가져오고, 검색할 수 있게 만들고, 실행 상태를 확인합니다.
2. 메뉴 위치¶
[상단 메뉴] > [검색 데이터] > [컬렉션 관리] > [컬렉션 설정]
URL: /search-data/collection/collection-status
3. 화면 구성¶

| 영역 | 설명 |
|---|---|
| 컬렉션 목록 | 번호, ALIAS·NAME, 유형, 최종갱신일, 수집문서 수, 색인어 수, 상태를 확인합니다. 행을 누르면 아래에 상세 탭이 열립니다. |
| 실행 버튼 | [전체 수집], [전체 색인], [전체 실행]으로 모든 컬렉션을 한꺼번에 처리합니다. |
| 순서변경 | 정렬 아이콘을 누르면 순서변경 모드가 됩니다. 행을 끌어 옮긴 뒤 [순서 저장]을 누릅니다. 되돌리려면 [취소]입니다. |
| 추가·새로고침 | [추가]로 컬렉션을 만들고, 새로고침으로 컬렉션 정보를 다시 읽어 옵니다. |
| 상태 표기 | 목록 위의 안내 줄입니다. 상태 열에 보이는 아이콘과 색이 무엇을 뜻하는지 알려 줍니다. |
| 전체 현황 | 전체 수집문서 수와 색인어 수를 확인합니다. |
상태 표기는 범례입니다
준비 완료·수집중·색인중·전체 실행·대기중은 눌러서 거르는 필터가 아니라,
상태 열의 아이콘을 읽는 방법을 알려 주는 설명입니다.
목록의 유형에는 DB, WEB, API 표시가 함께 보일 수 있습니다.
API 표시는 해당 DB 컬렉션에서 SNS 수집을 사용하고 있음을 뜻합니다.
상세 탭¶
탭은 화면에 보이는 순서대로 다음 일을 합니다.
| 탭 | 용도 |
|---|---|
| 상세 정보 | 컬렉션 이름, 유형, 저장 위치, 레코드 수, 색인어 수, 생성날짜, 최종 갱신일을 확인합니다. |
| API 설정 | DB 컬렉션에서 SNS 소스를 관리합니다. |
| 수집 설정 | DB 연결 정보 또는 웹사이트 수집 범위를 설정합니다. |
| 색인 설정 | 검색에 사용할 항목과 결과 표시 방식을 정합니다. |
| 구동 상태 | 수집·색인 작업을 실행하고 진행 상황과 로그를 확인합니다. |
| 스케줄링 | 이 컬렉션의 자동 실행 일정을 등록하고 확인합니다. |
[API 설정] 탭은 DB 유형에서만 보입니다.
WEB 유형은 탭이 5개입니다.
4. 주요 작업 방법¶
아래 순서는 화면의 탭 순서와 같습니다.
4.1 컬렉션 추가¶
- 목록 오른쪽의 [추가]를 클릭하면
컬렉션 신규 생성창이 열립니다. ALIAS(표시명)에 화면에 표시할 이름을 입력합니다.NAME(영문 식별자)에 영문 이름을 입력합니다.- 컬렉션 유형에서 DB(관계형 DB 연동) 또는 WEB(웹 수집·크롤링) 카드를 선택합니다.
- [저장]을 클릭합니다.
만들지 않으려면 [닫기]를 누릅니다.

NAME은 영문자로 시작해야 하며 영문, 숫자, 밑줄(_)만 사용할 수 있습니다.
저장한 뒤에는 NAME과 유형을 바꿀 수 없습니다.
표시 이름(ALIAS)만 [상세 정보] 탭에서 이름 옆 연필 아이콘으로 바꿀 수 있습니다.
4.2 SNS 수집 설정¶
SNS 수집은 DB 컬렉션의 [API 설정] 탭에서 사용합니다.
API 수집을 켜면 DB 수집을 시작할 때 등록한 SNS 데이터를 먼저 가져옵니다.

SNS 소스 등록¶
- DB 컬렉션을 선택하고 [API 설정] 탭을 엽니다.
API 수집 사용을 ON으로 켭니다.- [+ SNS 소스 등록]을 클릭합니다.
- SNS 유형과 사이트 ID, 필요한 인증 정보를 입력합니다.
- [등록 전 수집 테스트]를 실행합니다.
- 테스트가 성공하면 [저장]을 클릭합니다.
새 SNS 소스는 등록 전 수집 테스트에 성공해야 저장할 수 있습니다.
테스트 결과는 미리보기로만 보여 주며 실제 데이터에는 저장하지 않습니다.
| SNS 유형 | 입력할 주요 정보 | 사용할 수 있는 기능 |
|---|---|---|
| 블로그 | 네이버 블로그 ID | 수집, 수집 테스트 |
| 페이스북 | 페이지 ID와 연결 정보 | 수집, 수집 테스트, 토큰 테스트 |
| 인스타그램 | 연결 정보 | 수집, 수집 테스트, 토큰 테스트, 토큰 갱신 |
| 유튜브 | Google 인증 파일 두 개 | 수집, 수집 테스트 |
각 유형은 컬렉션마다 하나씩만 등록할 수 있습니다.
블로그, 페이스북, 인스타그램, 유튜브를 모두 등록하면 최대 4개입니다.
네 유형을 모두 등록한 상태에서는 [+ SNS 소스 등록] 버튼을 사용할 수 없습니다.
토큰 발급 안내
토큰 발급 방법은 별도 매뉴얼로 안내합니다.
발급 매뉴얼이 필요하면 담당자에게 문의하세요.
등록한 SNS 소스 관리¶
각 SNS 카드에서 다음 작업을 할 수 있습니다.
| 기능 | 설명 |
|---|---|
| 전체·증분 | 전체 데이터를 다시 가져오거나, 변경된 데이터만 가져오도록 선택합니다. |
| 사용 | 이 SNS 소스를 수집에 포함할지 정합니다. |
| 수집 | 선택한 방식으로 실제 SNS 데이터를 가져옵니다. |
| 수집 테스트 | 저장하지 않고 가져올 수 있는지 확인합니다. |
| 토큰 테스트 | 페이스북·인스타그램 토큰이 현재 사용할 수 있는지 확인합니다. |
| 토큰 갱신 | 인스타그램 토큰을 새로 갱신합니다. |
| 수집 로그 | SNS 수집 결과와 오류 내용을 확인합니다. |
인스타그램은 마지막 갱신 후 50일이 지난 뒤, 다음 수집을 시작할 때 토큰을 자동 갱신합니다.
카드에 표시되는 자동 갱신 예정일과 만료일을 확인하세요.
SNS의 수집·색인 설정¶
SNS 소스를 등록하면 수집 설정과 색인 설정이 자동으로 맞춰집니다.
따로 손대지 않아도 바로 검색할 수 있는 상태가 됩니다.
| 자동으로 정해지는 것 | 내용 |
|---|---|
| 항목 이름 | SNS 수집 테이블의 각 항목에 알아보기 쉬운 한글 이름이 붙습니다. |
| 게시일시 타입 | 게시일시 항목이 날짜 타입으로 지정되어 최신순 정렬이 바로 동작합니다. |
| 제목·본문 | SNS 유형별로 제목과 본문에 해당하는 항목이 색인 대상으로 켜지고 검색성격도 지정됩니다. |
| SNS 유형 | 제목이 되는 항목 | 본문이 되는 항목 |
|---|---|---|
| 블로그 | POST_TITLE |
POST_DESCRIPTION |
| 페이스북 | SOURCE_SITE_NAME |
POST_MESSAGE |
| 인스타그램 | SOURCE_SITE_NAME |
CAPTION |
| 유튜브 | VIDEO_TITLE |
VIDEO_DESCRIPTION |
SNS 컬렉션의 수집·색인 설정은 그대로 두세요
위 설정은 SNS 수집에 맞게 미리 맞춰 둔 값이므로 변경하지 않는 것을 권장합니다.
특히 게시일시의 타입을 바꾸면 최신순 정렬이 동작하지 않습니다.
꼭 바꿔야 한다면 바꾼 뒤 수집과 색인을 다시 실행하고 검색 결과를 확인하세요.
한 번 저장하면 자동으로 되돌아가지 않습니다
운영자가 색인 설정을 저장한 뒤에는 자동 설정이 그 값을 덮어쓰지 않습니다.
잘못 바꾼 경우 직접 원래대로 되돌려야 합니다.
연결 정보 보호
SNS 연결 정보와 인증 파일은 다른 사람에게 전달하거나 화면 캡처에 포함하지 마세요.
수집이 되지 않으면 먼저 토큰 테스트를 실행하세요.
4.3 수집 설정¶
DB 컬렉션¶
DB 컬렉션을 선택한 뒤 [수집 설정] 탭에서 연결할 DB와 가져올 데이터를 정합니다.

| 영역 | 하는 일 |
|---|---|
| 컬렉션 DB 구성 | 연결할 DB를 등록합니다. [검증]으로 연결되는지 먼저 확인하세요. |
| 수집대상 테이블 및 쿼리 목록 | 가져올 테이블이나 조회 쿼리를 등록합니다. |
| 메타필드 목록 | 선택한 테이블의 컬럼 목록입니다. 가져올 컬럼을 고르고 타입을 지정합니다. |
| 수집제외필터 설정 | 특정 조건의 데이터를 수집에서 빼고 싶을 때 등록합니다. |
| DB Prefix 설정 | 테이블에 저장된 값 앞에 붙일 기준 경로를 등록합니다. |
- 컬렉션 DB 구성에서 연결 정보를 등록하고 [검증]으로 연결되는지 확인합니다.
- 수집대상 테이블 및 쿼리 목록에서 가져올 테이블이나 쿼리를 등록합니다.
- 메타필드 목록에서 가져올 컬럼의 수집여부를 켜고
Key Type·Data Type을 지정한 뒤 저장합니다.
표시 순서를 바꾸려면 [순서변경]을 사용합니다. - 저장한 뒤 [구동 상태]에서 수집과 색인을 실행합니다.
DB 연결 추가¶
- [컬렉션 DB 구성] 카드에서 [추가]를 클릭합니다.
- 왼쪽
연결 선택에서 [신규 등록]을 선택합니다.
이미 등록한 DB를 이 컬렉션에 연결하려면 그 항목을 선택합니다. DB 이름,DB Alias,DB 유형 (JDBC)을 입력하거나 선택합니다.
DB Alias는 이 화면에서 연결을 구분하는 이름입니다.드라이버 버전은 기본값을 사용하거나, 설치된 버전 중 DB에 맞는 항목을 선택합니다.호스트와포트, 필요하면아이디와비밀번호를 입력합니다.- 기본 JDBC URL을 사용할 때는
직접 입력 (자동 생성 끄기)를 끈 채로 둡니다.
별도 URL이 필요한 경우에만 이 옵션을 켜고 URL을 직접 입력합니다. - [연결 테스트]로 접속 정보를 확인한 뒤 [저장]을 클릭합니다.
- 저장이 끝나면 수집 설정 화면의 [검증]으로 컬렉션에 연결한 DB를 다시 확인합니다.
DB 이름, DB Alias, DB 유형, 호스트, 포트는 반드시 입력해야 합니다.
기존 DB를 선택해 수정하면, 그 DB를 연결한 다른 컬렉션의 접속 정보도 함께 바뀝니다.
JDBC 드라이버 버전 관리¶
보통은 드라이버 버전의 기본값(번들 최신)을 그대로 사용합니다.
구버전 드라이버가 필요하거나 기본 드라이버가 없는 DB 유형이면 [관리]를 클릭합니다.
드라이버 관리창에서 현재 DB 유형에 설치된 드라이버와 버전을 확인합니다.- 필요한 드라이버가 없으면
드라이버 추가 (JAR 업로드)에서 JDBC 드라이버 JAR 파일과 버전을 입력하고 [업로드]를 클릭합니다. - 창을 닫고
드라이버 버전목록에서 업로드한 버전을 선택합니다.
번들 드라이버는 삭제할 수 없습니다.
드라이버 추가와 외부 드라이버 삭제는 관리자만 할 수 있습니다.
연결 정보와 삭제 범위를 확인하세요
비밀번호와 JDBC URL에는 접속 정보가 들어갈 수 있으므로 화면 캡처나 외부 문서에 포함하지 마세요.
카드의 연결 해제는 현재 컬렉션에서만 DB·테이블·필드 설정을 떼어 냅니다.
반면 연결 선택의 휴지통은 등록된 DB 자체를 영구 삭제하는 기능이므로, 다른 컬렉션에서 사용 중인지 먼저 확인하세요.
수집대상 테이블 추가¶
DB를 선택한 뒤 [수집대상 테이블 및 쿼리 목록]에서 [추가]를 클릭합니다.
수집 유형에서 [테이블]을 선택합니다.테이블 지정 방식에서 테이블을 고르는 방법을 선택합니다.- [목록에서 선택]: 연결한 DB에서 읽어 온 테이블 후보 중 하나를 고릅니다.
일반적으로 이 방법을 사용합니다. - [직접 입력]: 목록에 없는 이름을 직접 입력합니다.
연결한 DB에서 찾을 수 있는 테이블 이름이어야 저장할 수 있습니다. 테이블 Alias에 운영자가 알아보기 쉬운 이름을 입력합니다.
목록에서 선택하면 처음에는 테이블 이름과 같은 값으로 채워집니다.- [저장]을 클릭합니다.
- 목록에 추가된 행을 클릭한 뒤, 아래 [메타필드 목록]에서 수집할 컬럼을 설정합니다.
수집대상 쿼리 추가¶
테이블 하나만으로 필요한 데이터를 만들기 어렵거나, 여러 테이블을 조합해야 하면 사용자 SQL 쿼리를 등록합니다.
- [수집대상 테이블 및 쿼리 목록]에서 [추가]를 클릭하고
수집 유형에서 [쿼리]를 선택합니다. 기준 테이블 선택에서 쿼리의 기준이 되는 테이블을 고릅니다.
직접 입력할 수도 있지만, 연결한 DB에서 찾을 수 있는 기준 테이블 이름이어야 합니다.Alias에 목록에서 구분할 이름을 입력합니다.전체 수집에수집 전,수집SQL을 입력합니다.- [쿼리 테스트]를 클릭합니다.
수집 전 SQL은 건수를 확인하고, 수집 SQL은 실제로 실행합니다. - 두 단계가 모두 성공하고
도출 메타필드 미리보기가 맞는지 확인한 뒤 [저장]을 클릭합니다.
테스트를 통과하기 전에는 저장할 수 없습니다. - 저장 후 목록에서 쿼리 행을 클릭하고, 자동으로 등록된 메타필드의 수집여부와 타입을 확인·저장합니다.
쿼리 테스트는 데이터를 읽습니다
쿼리 테스트의 수집 SQL은 실제 DB에서 실행됩니다.
데이터 변경 SQL은 넣지 말고, 필요한 데이터만 조회하는 SQL로 작성하세요.
테이블·쿼리 목록의 수정 아이콘으로 설정을 바꿀 수 있습니다.
연결 해제 아이콘은 DB의 원본 테이블이나 쿼리를 지우지 않고, 현재 컬렉션에서만 연결과 관련 필드·색인 설정을 해제합니다.
메타필드 목록의 항목¶
| 열 | 설명 |
|---|---|
| 수집여부 | 이 컬럼을 가져올지 정합니다. 머리글의 전체로 한 번에 켜고 끌 수 있습니다. |
| 순번 (fileId) | 수집한 순서 번호입니다. 수집여부를 켠 컬럼에만 붙습니다. |
| 메타필드명 · Alias | 위쪽이 실제 컬럼 이름, 아래쪽이 화면과 검색 결과에 쓸 이름입니다. 둘 다 고칠 수 있습니다. |
| 컬럼타입 (컬럼의 Length) | DB에 정의된 타입과 길이입니다. 참고용이며 고칠 수 없습니다. |
| Key Type | 이 컬럼의 값을 어떤 데이터로 다룰지 정합니다. 아래 표를 참고하세요. |
| Data Type | 값을 String(문자)으로 다룰지 Number(숫자)로 다룰지 정합니다. |
Key Type — 값의 종류 고르기¶
| Key Type | 어떤 컬럼에 쓰나요 |
|---|---|
Normal |
일반 문자 컬럼입니다. 대부분의 컬럼이 여기에 해당합니다. |
Normal [HTML태그제거] |
값에 HTML 태그가 섞여 있을 때 씁니다. 태그를 걷어 내고 글자만 남깁니다. |
File (Text) |
컬럼에 첨부파일의 저장 경로가 들어 있을 때 씁니다. 파일 내용을 추출해 수집합니다. |
File (Text) [HTML태그제거] |
위와 같되, 파일에서 추출한 내용의 HTML 태그를 걷어 냅니다. |
BLOB · BLOB [HTML태그제거] |
DB 컬럼값 자체가 이진 BLOB일 때 씁니다. 파일 경로를 따라가 제목·본문·경로 하위 항목을 만드는 유형이 아닙니다. |
CLOB · CLOB [HTML태그제거] |
컬럼 안에 아주 긴 글이 담겨 있을 때 씁니다. |
Date [TIMESTAMP] |
날짜 컬럼입니다. DB가 표준 시각 형식으로 저장할 때 씁니다. |
Date [YYYYMMDD] · [YYYY:MM:DD] · [YYYY-MM-DD] · [YYYY/MM/DD] · [YYYY/MM/DD HH:MM:SS] |
날짜가 문자로 저장돼 있을 때, 저장된 모양과 똑같은 것을 고릅니다. |
PrimaryKey |
문서를 하나로 구분하는 고유 값입니다. 컬렉션마다 하나 지정합니다. |
날짜 컬럼은 반드시 Date 타입으로 지정하세요
등록일·작성일 같은 날짜 컬럼의 Key Type을 Date [...]로 지정하지 않으면
검색 결과를 최신순으로 정렬할 수 없습니다.
저장된 모양과 다른 형식을 고르면 날짜를 잘못 읽으니, 값을 직접 확인한 뒤 고르세요.
File 계열을 고르면 항목이 늘어납니다
File (Text) 계열을 고르면 [색인 설정]에 제목·본문·경로 하위 항목이 자동으로 만들어집니다.
첨부파일을 검색 대상으로 삼을 때 사용합니다.
파일에서 추출한 내용은 본문 하위 항목에 들어가므로, 파일 내용 검색에는 본문만 색인여부와 검색성격을 지정하세요 — 첨부파일 내용을 본문으로 쓰기 참고.
파일이 서버의 다른 위치에 있으면 아래 DB Prefix 설정을 함께 등록하세요.
수집여부와 색인여부는 다릅니다
수집 설정의 수집여부는 "이 컬럼을 가져올지"를 정합니다.
가져온 항목 중 무엇을 검색에 쓸지는 [색인 설정] 탭의 색인여부에서 정합니다.
SNS 수집 테이블은 그대로 두세요
SNS 수집으로 만들어진 테이블(T_SNS_...)의 메타필드는 자동으로 맞춰져 있습니다.
이름과 게시일시 타입을 바꾸면 검색 결과나 최신순 정렬이 어긋날 수 있으니 변경하지 않는 것을 권장합니다.
자세한 내용은 SNS의 수집·색인 설정을 참고하세요.
수집제외필터 설정¶
가져오지 않을 데이터를 조건으로 걸러 냅니다.

| 열 | 설명 |
|---|---|
| DB · Table · Field | 조건에 사용할 메타필드입니다. 어느 DB의 어느 테이블·컬럼인지 함께 보여 줍니다. |
| 연산자 | matches(같은 값), =, >, >=, <, <= 중에서 고릅니다. |
| 값 / 패턴 | 비교할 값입니다. |
| 관리 | 이 규칙을 지웁니다. |
- 위쪽 메타필드 목록에서 조건에 쓸 컬럼이 수집 대상인지 확인합니다.
- [추가]를 클릭해 메타필드·연산자·값을 지정합니다.
- [저장]을 클릭합니다.
조건에 맞는 데이터는 수집 단계에서 빠지므로 검색 결과에도 나오지 않습니다.
예를 들어 LANG 필드가 zh인 문서를 빼고 싶다면 LANG · matches · zh로 등록합니다.
DB Prefix 설정¶
DB에는 파일 이름이나 상대 경로만 들어 있고 실제 파일은 서버의 다른 위치에 있을 수 있습니다.
이때 DB Prefix 설정에 기준 경로를 등록해 두면, 수집할 때 그 경로를 앞에 붙여 실제 파일을 찾습니다.

- [추가]를 클릭해 행을 하나 만듭니다.
Table Name에 대상 테이블 이름을 입력합니다.Path에 앞에 붙일 기준 경로를 입력합니다.- [저장]을 클릭합니다.
행을 지우려면 오른쪽 관리의 삭제 아이콘을, 저장 전 상태로 되돌리려면 되돌리기 아이콘을 누릅니다.
첨부파일을 수집하는 컬렉션에서 주로 사용합니다.
WEB 컬렉션¶
WEB 컬렉션은 웹페이지를 검색 대상으로 만듭니다.

화면은 네 개의 카드로 나뉘며, 카드마다 [저장]이 따로 있습니다.
시작하기 전에 — 수집할 수 있는 사이트인지 확인¶
수집기는 사이트가 보내 주는 HTML 원본을 그대로 읽습니다.
브라우저처럼 화면을 그려 보지 않기 때문에, 원본에 없는 내용은 가져올 수 없습니다.
설정하기 전에 다음처럼 확인하세요.
- 수집할 페이지를 브라우저로 엽니다.
- 빈 곳에서 마우스 오른쪽 버튼 → [페이지 소스 보기]를 선택합니다.
- 검색되게 하려는 제목과 본문 글자가 그 안에 그대로 보이는지 확인합니다.
글자가 보이면 수집할 수 있습니다.
글자는 없고 script 같은 코드만 보인다면, 그 내용은 화면을 열 때 만들어지는 것이라 수집되지 않습니다.
화면에 보여도 원본에 없으면 수집되지 않습니다
최근 사이트는 내용을 화면에서 즉석으로 만들어 내는 방식이 많습니다.
이런 페이지는 브라우저에는 정상으로 보여도 페이지 소스 보기에는 내용이 없어 수집 결과가 비거나 제목만 들어옵니다.
수집했는데 문서 수가 0이거나 본문이 비어 있다면 먼저 이 부분을 확인하세요.
해당 사이트가 이런 방식이라면 담당자와 다른 수집 방법을 협의해야 합니다.
수집 대상¶
| 항목 | 설명 |
|---|---|
| 시작 URL (Seed) | 수집을 시작할 주소입니다. 한 줄에 하나씩, https://부터 전부 적습니다. |
| 수집 범위 도메인 (Scope) | 돌아다녀도 되는 도메인입니다. 여기에 없는 도메인으로는 넘어가지 않습니다. |
목록은 오른쪽 [선택 항목 편집] 패널에서 고칩니다.
여러 건을 한 번에 넣으려면 [일괄 편집]을 사용합니다.
웹 컬렉션이 가져오는 것
웹 페이지 내용만 수집합니다.
페이지에 걸려 있는 PDF·이미지 같은 첨부파일은 수집하지 않습니다.
추출 영역 (제목·본문)¶
제목과 본문을 페이지의 어느 부분에서 가져올지 지정합니다.
제목과 본문 탭으로 나뉘어 있습니다.
| 항목 | 설명 |
|---|---|
| 적용할 URL 패턴 | 이 규칙을 어느 주소에 적용할지 정합니다.*는 "아무 글자나"라는 뜻입니다. |
| CSS Selector | 가져올 위치의 이름입니다. 제목은 h1·title, 본문은 article·main처럼 어느 사이트에나 있는 이름이 안정적입니다. |
| 시작/종료 토큰 | CSS Selector로 잡기 어려울 때, 본문의 시작과 끝을 알리는 문자열로 범위를 지정합니다. |
CSS Selector는 article처럼 이름만 적으면 그 부분 전체, .notice처럼 점을 붙이면 그 이름이 달린 부분을 뜻합니다.
맞는 곳이 여러 개면 페이지에서 맨 처음 하나만 적용됩니다.
여기에 지정하는 위치도 페이지 소스 보기에 있는 것이어야 합니다.
브라우저 개발자 도구(F12)에는 보이지만 페이지 소스에는 없는 위치를 적으면 내용이 들어오지 않습니다.
수집 규칙¶
| 항목 | 설명 |
|---|---|
| Seed Only | 켜면 시작 URL의 페이지만 수집하고, 그 안의 링크는 따라가지 않습니다. |
| robots.txt 준수 | 사이트가 전체에 걸어 둔 수집 금지 안내를 먼저 확인해, 막아 둔 주소는 받아오기 전에 걸러냅니다. |
| meta robots 태그 준수 | 페이지를 받아온 뒤, 그 페이지에 붙어 있는 검색 허용·금지 표시를 읽어 따릅니다. |
| 동적 페이지(CGI) 수집 | 주소에 ?가 붙는 동적 페이지도 수집할지 정합니다. |
| Hop | 찾은 링크를 몇 단계까지 따라 들어갈지 정합니다. 게시판·달력처럼 링크가 끝없이 이어지는 곳에서 수집이 무한정 늘어나는 것을 막습니다. |
| Depth | 주소가 /로 몇 단계까지 내려간 페이지를 수집할지 정합니다. |
| 페이지 최소 용량 | 이보다 작은 페이지는 수집하지 않습니다. 오류 안내 페이지가 검색 결과에 섞이는 것을 막습니다. |
| 페이지 최대 용량 | 이보다 큰 페이지는 수집하지 않습니다. 지나치게 무거운 페이지를 거릅니다. |
robots.txt 준수와 meta robots 태그 준수의 차이
robots.txt 준수는 사이트 전체에 걸린 규칙이고,
meta robots 태그 준수는 페이지 하나하나에 걸린 규칙입니다.
서로 보완합니다.
URL 패턴¶
어떤 주소를 수집할지 세 가지 목록으로 정합니다.
| 탭 | 설명 |
|---|---|
| 수집대상 (포함) | 여기에 등록한 형태에 맞는 페이지만 수집합니다. |
| 수집제외 | 여기에 맞는 주소는 수집하지 않습니다. 수집대상에 맞더라도 제외가 우선입니다. |
| 링크추출 금지 (NO FOLLOW) | 페이지는 수집하되 그 안의 링크는 따라가지 않습니다. |
패턴의 *는 "아무 글자나"라는 뜻이며 주소 전체와 맞춰 봅니다.
예를 들어 */board/notice*는 공지 게시판만, *login*은 로그인 페이지를 뜻합니다.
수집대상(포함)을 비우면 아무것도 수집되지 않습니다
수집대상 (포함)에 적은 형태만 수집합니다.
전부 수집하려면 * 하나를 등록하세요.
작업 순서¶
- 시작 URL (Seed)에 수집을 시작할 주소를
https://부터 전부 입력합니다. - 수집 범위 도메인 (Scope)에 수집을 허용할 도메인을 등록합니다.
- 추출 영역에서 제목과 본문을 가져올 위치를 지정합니다.
- 수집 규칙에서 따라갈 범위와 거를 크기를 정합니다.
- URL 패턴의
수집대상 (포함)에 수집할 주소 형태를 등록합니다. - 각 카드를 [저장]한 뒤 [구동 상태]에서 수집과 색인을 실행합니다.
4.4 색인 설정¶
색인 설정은 가져온 데이터 중 어떤 항목을 검색과 결과 표시에 사용할지 정하는 곳입니다.
DB 유형¶
화면 위쪽에 지금 보고 있는 DB와 수집대상이 표시됩니다.

메타필드 목록의 항목¶
| 열 | 설명 |
|---|---|
| 번호 | 표시 순서입니다. |
| 메타필드명 | 항목 이름(FIELD)과 데이터 종류(DATATYPE)를 함께 보여 줍니다. |
| 색인 크기 | 이 항목에서 색인에 사용할 최대 길이입니다. 이 길이를 넘는 뒷부분은 검색되지 않습니다. |
| 색인여부 | 켜면 이 항목의 내용으로 검색할 수 있습니다. |
| 간략출력 | 켜면 검색 결과 목록에 이 항목을 함께 보여 줍니다. 제목·요약처럼 목록에서 바로 보여 줄 항목에 켭니다. |
| 정렬 | 정렬에 사용할 항목입니다.문자와 숫자 중 하나만 고릅니다.글자 순으로 줄 세울 항목은 문자, 숫자·날짜처럼 크기 순으로 줄 세울 항목은 숫자입니다. |
| 파티션필터 | 아래 파티션 설정에서 조건으로 쓸 항목에 켭니다. |
| 중요도값 | 이 항목에 문서별 중요도 점수가 숫자로 들어 있을 때 켭니다. 그 값을 문서의 중요도로 함께 반영합니다. |
| Ngram분석 | 켜면 글자를 잘게 쪼개서도 색인합니다. 단어 중간의 일부만 입력해도 찾게 하고 싶을 때 씁니다. |
| 중요도 | 이 항목이 검색 순위에 얼마나 크게 반영될지 정합니다.1~1000 사이의 숫자이고, 클수록 크게 반영됩니다. |
| 검색성격 | 이 항목이 문서에서 어떤 역할인지 고릅니다.제목·본문·작성자·일반 중 하나입니다. |
중요도와 중요도값의 차이¶
이름이 비슷하지만 하는 일이 다릅니다.
중요도는 항목에 매기는 점수이고, 중요도값은 문서마다 다른 점수를 데이터에서 가져오는 설정입니다.
| 중요도 | 중요도값 | |
|---|---|---|
| 무엇을 정하나요 | 이 항목의 점수 | 이 문서의 점수 |
| 어디서 값이 오나요 | 운영자가 직접 입력(1~1000) |
컬럼에 들어 있는 숫자 값 |
| 점수가 붙는 곳 | 그 항목에서 뽑힌 검색어에만 | 그 문서의 모든 검색어에 |
| 어떻게 지정하나요 | 숫자를 입력 | 체크박스를 켬 |
중요도는 "제목에서 맞은 것이 본문에서 맞은 것보다 더 중요하다"처럼 항목끼리 우선순위를 줄 때 씁니다.
예를 들어 제목의 중요도를 100, 본문을 3으로 두면 같은 단어라도 제목에서 맞은 문서가 위로 올라옵니다.
중요도값은 데이터에 이미 문서별 점수 컬럼이 있을 때 씁니다.
예를 들어 추천수나 가중치 같은 숫자 컬럼이 있다면, 그 항목의 중요도값을 켜서 값이 큰 문서가 위로 오게 합니다.
이때는 컬럼에 든 숫자가 그 문서 전체의 점수로 얹히므로, 검색어가 어디에서 맞았든 똑같이 올라갑니다.
중요도값은 숫자 컬럼에만 켜세요
켠 항목의 값이 숫자가 아니거나 0이면 아무 점수도 더해지지 않습니다.
이때는 그 항목에 입력해 둔 중요도까지 함께 무시되므로, 순위를 올리려다 오히려 낮아질 수 있습니다.
문서별 점수 컬럼이 따로 없다면 켜지 말고 중요도만으로 조정하세요.
중요도값을 켠 항목은 중요도를 크게 잡지 마세요
중요도값을 켜면 그 항목의 중요도가 두 번 반영됩니다.
검색어마다 한 번, 문서 점수에 다시 한 번 더해집니다.
의도한 것보다 순위가 크게 튈 수 있으니 이런 항목의 중요도는 낮게(기본값 1 수준) 두는 편이 안전합니다.
검색 결과를 인기순으로 정렬하려면
조회수 항목(hit)의 정렬을 숫자로 지정해야 합니다.
수집 설정에서 그 컬럼의 수집여부도 함께 켜져 있어야 합니다.
지정하지 않으면 검색 출력 옵션에서 인기순을 골라도 아무 안내 없이 무시됩니다.
제목과 본문은 각각 최소 1개씩 반드시 지정하세요
검색성격이 제목인 항목과 본문인 항목이 각각 하나 이상 있어야 합니다.
빠진 것이 있으면 목록 위에 검색성격이 「제목」, 「본문」인 필드가 없습니다. 각각 최소 1개씩 지정해 주세요. 경고가 표시됩니다.
제목은 검색 결과의 제목으로 표시되고, 본문은 내용 검색과 요약 표시에 사용됩니다.
둘 중 하나라도 없으면 검색 결과가 제대로 나오지 않습니다.
일반은 특별한 역할이 없는 나머지 항목에 씁니다.
작성자로 검색되게 하려면¶
글쓴이·등록자처럼 누가 썼는지를 담은 항목은 검색성격을 작성자로 지정합니다.
이렇게 지정한 항목은 검색 화면에서 작성자로 범위를 좁혀 검색할 때 사용됩니다.
- 글쓴이가 담긴 항목의 색인여부를 켭니다.
- 같은 줄의 검색성격을
작성자로 선택합니다. - [저장]한 뒤 수집과 색인을 다시 실행합니다.
색인여부를 켜지 않으면 작성자로 검색되지 않습니다
검색성격만 작성자로 바꾸고 색인여부를 켜지 않으면 그 항목은 색인되지 않습니다.
색인되지 않은 항목은 검색 대상이 아니므로, 작성자 이름을 정확히 입력해도 결과가 나오지 않습니다.
검색성격과 색인여부는 반드시 함께 지정하세요.
제목·본문도 마찬가지입니다
검색성격은 그 항목의 역할만 정합니다.
실제로 검색되게 하는 것은 색인여부이므로, 검색에 쓸 항목은 모두 색인여부를 켜야 합니다.
첨부파일 내용을 본문으로 쓰기¶
수집 설정에서 File 계열을 고른 항목은 색인 설정에서 제목·본문·경로 하위 항목 세 개가 자동으로 만들어집니다.
파일에서 뽑아낸 텍스트는 본문 하위 항목에 들어갑니다.

| 하위 항목 | 담기는 내용 |
|---|---|
<항목명>_제목 |
파일에서 뽑아낸 제목 |
<항목명>_본문 |
파일에서 뽑아낸 본문 내용 |
<항목명>_경로 |
파일이 있는 경로 |
첨부파일에서 추출한 내용으로 검색되게 하려면 <항목명>_본문 줄에서 다음을 지정합니다.
- 색인여부를 켭니다.
- 검색성격을
본문으로 선택합니다. - [저장]한 뒤 수집과 색인을 다시 실행합니다.
예를 들어 FILE_PATH 항목을 File 계열로 지정했다면, 그 아래 FILE_PATH_본문 줄에서 색인여부를 켜고 검색성격을 본문으로 고릅니다.
제목과 경로 하위 항목은 자동으로 만들어지지만, 파일 본문 검색에는 사용하지 않습니다.
본문 하위 항목을 지정하지 않으면 파일 내용이 검색되지 않습니다
하위 항목이 만들어졌다고 해서 자동으로 검색되는 것은 아닙니다.
_본문 줄의 색인여부와 검색성격을 직접 지정해야 파일에서 뽑아낸 내용으로 검색할 수 있습니다.
SNS 컬렉션은 색인 설정을 바꾸지 마세요
SNS 수집 테이블은 제목·본문과 게시일시가 이미 알맞게 지정되어 있습니다.
변경하지 않는 것을 권장하며, 자세한 내용은 SNS의 수집·색인 설정을 참고하세요.
작업 순서¶
- 검색할 항목은 색인여부를 켭니다.
- 검색 결과에 짧게 보여 줄 항목은 간략출력을 켭니다.
- (필수) 제목에 해당하는 항목의 검색성격을
제목으로 지정합니다. - (필수) 본문에 해당하는 항목의 검색성격을
본문으로 지정합니다. - 정렬에 쓸 항목은
문자또는숫자중 하나를 고릅니다. - 순위를 조정할 항목은 중요도를 올립니다.
- 목록 위에 경고가 남아 있지 않은지 확인합니다.
- [저장]한 뒤 수집과 색인을 다시 실행합니다.
파티션 설정¶
파티션은 메타필드 값 조건으로 문서를 나눠, 검색 화면의 섹션으로 묶는 설정입니다.

| 열 | 설명 |
|---|---|
| 파티션명 | 화면에 표시할 이름입니다. 컬렉션 안에서 겹치면 안 되고 한글 14자 이내입니다. |
| 메타필드 | 조건에 사용할 항목입니다. 색인 설정에서 파티션필터를 켜 둔 항목을 고릅니다. |
| 연산자 | matches(같은 값), =, >, >=, <, <= 중에서 고릅니다. |
| 값/패턴 | 비교할 값입니다.*는 "아무 값이나"를 뜻합니다. |
| 관리 | 이 행을 지웁니다. |
- [추가]를 클릭해 행을 만듭니다.
- 파티션명, 메타필드, 연산자, 값/패턴을 입력합니다.
- [저장]을 클릭합니다.
파티션은 최대 40개까지 등록할 수 있습니다
컬렉션 하나에 파티션을 최대 40개까지 등록할 수 있습니다.
40개에 도달하면 [추가] 버튼이 비활성화됩니다.
행 순서가 중요합니다
문서 한 건은 위에서부터 처음 조건이 맞는 파티션 하나에만 속합니다.
여러 파티션에 동시에 들어가지 않으므로, 좁은 조건을 위에 두고 넓은 조건을 아래에 두세요.
파티션으로 섹션을 구성해도 수집과 색인은 모든 문서에 대해 진행됩니다.
검색 결과에는 각 섹션에 연결된 파티션의 문서만 표시됩니다.
예를 들어 LANG matches en으로 영문 문서를 나눴다면, 영문 이외 문서도 검색 결과에 표시하려면 LANG matches *를 마지막에 추가합니다.
만든 파티션은 검색 메뉴 및 섹션에서 섹션에 연결해 사용합니다.
WEB 유형¶
WEB 유형은 웹페이지에서 뽑아내는 항목이 정해져 있어, 색인 설정도 자동으로 맞춰져 있습니다.
따로 손대지 않아도 바로 검색할 수 있는 상태입니다.

| 항목 | 무엇인가요 | 검색성격 |
|---|---|---|
title |
페이지 제목 | 제목 |
body |
페이지 본문 | 본문 |
author |
페이지에 적힌 작성자 정보 | 일반 |
copyright |
페이지에 적힌 저작권 정보 | 일반 |
description |
페이지 요약 설명 | 일반 |
keywords |
페이지에 적힌 키워드 | 일반 |
여섯 항목 모두 색인 대상으로 켜져 있고, 본문을 뺀 나머지는 간략출력도 켜져 있습니다.
기본값 그대로 사용해도 됩니다
웹페이지 수집에 맞게 미리 맞춰 둔 값이라 대부분 그대로 두고 쓰시면 됩니다.
필요하면 중요도나 간략출력 같은 항목을 조정할 수 있습니다.
바꾼 뒤에는 수집과 색인을 다시 실행하고 검색 결과를 확인하세요.
4.5 구동 상태 — 수집·색인 실행과 확인¶
컬렉션을 선택한 뒤 [구동 상태] 탭에서 실행하고, 진행 상황을 확인합니다.

실행하기¶
| 버튼 | 설명 |
|---|---|
| 수집 범위 | 이번에 실행할 범위입니다.전체는 데이터를 처음부터 다시 가져옵니다.수집기 실행과 전체 실행에 적용됩니다. |
| 수집기 실행 | 원본 데이터나 웹페이지를 가져옵니다. |
| 색인기 실행 | 가져온 데이터를 검색할 수 있게 만듭니다. |
| 전체 실행 | 수집 후 색인까지 차례로 실행합니다. |
| 중지 | 실행 중일 때 나타나며, 진행 중인 작업을 중단합니다. |
설정을 바꾼 뒤에는 수집과 색인을 다시 실행해야 검색 결과에 반영됩니다.
진행 상황 보기¶
아래에 수집기와 색인기 카드가 나란히 표시됩니다.
- 카드 위쪽에 현재 상태(
준비,진행 중등)가 보입니다. - 진행률 막대에 처리한 건수와 백분율이 표시됩니다.
- 단계 배지로 어디까지 진행됐는지 확인합니다.
수집기는설정 로드→수집→완료, 색인기는환경설정 로드→색인 시작→문서 색인→KIF 생성→마무리→완료순입니다. - 아래쪽에 소요 시간과 결과 요약(완료 테이블 수, 토큰·단어·섹터 수)이 표시됩니다.
상세 조회 — 실행 로그 보기¶
[상세 조회]를 누르면 상세 로그 창이 열립니다.

- 위쪽에서 볼 로그를 고릅니다.
DB 수집기,웹 수집기,색인기,색인 후처리중 컬렉션 유형에 맞는 것만 눌립니다. 정상(MSG)과에러(ERR)중 볼 내용을 고릅니다.
옆의 숫자는 줄 수입니다.- 찾을 말이 있으면 검색창에 입력합니다.
Enter는 다음, Shift+Enter는 이전, Esc는 지우기입니다. 라인 수로 한 번에 읽어 올 줄 수를 조절합니다.- 확인이 끝나면 [닫기]를 누릅니다.
수집이나 색인이 실패했을 때는 에러(ERR)를 먼저 확인하세요.
구동 리포트 — 실행 이력 보기¶
[구동 리포트]를 누르면 지금까지의 실행 결과가 요약되어 나타납니다.

- 왼쪽 목록에서 실행 이력을 고릅니다.
수집기·색인기 구분, 성공 여부, 실행 시각, 처리 건수가 보입니다. - 오른쪽에 선택한 실행의 소요 시간과 통계(키워드 수, 전체 문서 수, 총 수집 수, 타입 수)가 표시됩니다.
- 확인이 끝나면 [닫기]를 누릅니다.
4.6 스케줄링 — 자동 실행 일정¶
[스케줄링] 탭에서는 지금 보고 있는 컬렉션의 자동 실행 일정을 등록하고 확인합니다.

- 왼쪽
스케줄 추가에서 컬렉션이 지금 컬렉션으로 고정되어 있는지 확인합니다. - 실행 시간에서 주기(
매일·매주·매월·매년)와오전·오후, 시, 분을 고릅니다. 수집모드는 전체수집입니다.저장될 실행 시간에 표시된 문구가 원하는 시각과 맞는지 확인합니다.- [등록]을 클릭합니다.
입력을 처음 상태로 되돌리려면 [초기화]입니다.
등록한 일정은 오른쪽 스케줄링 목록에 쌓입니다.
컬렉션이 이미 정해져 있으므로 목록은 시간과 수집모드 두 열만 보여 주며, 오른쪽 끝 삭제 아이콘으로 지웁니다.
여러 컬렉션의 일정을 한곳에서 보거나 수정하려면 스케줄링 관리 화면을 사용하세요.
4.7 컬렉션 삭제¶
목록 오른쪽의 삭제 아이콘을 클릭하고 확인합니다.
삭제하면 컬렉션 설정과 검색 데이터가 함께 삭제되며 복구할 수 없습니다.
5. 주의사항¶
전체 실행 전 확인
데이터가 많은 컬렉션의 전체 실행은 오래 걸릴 수 있습니다.
이용자가 적은 시간에 실행하세요.
- 수집·색인 설정을 바꾼 뒤에는 다시 실행해야 합니다.
- 컬렉션을 검색 결과에 표시하려면 검색 메뉴 및 섹션에서 섹션에 연결해야 합니다.
실행 중에 잠기는 기능¶
수집·색인이 도는 동안에는 결과가 어긋나지 않도록 일부 기능이 잠깁니다.
잠긴 버튼은 비활성으로 표시되고, 마우스를 올리면 이유가 나타납니다.
| 잠기는 범위 | 잠기는 기능 |
|---|---|
| 어느 컬렉션이든 실행 중이면 | 컬렉션 순서변경, 컬렉션 삭제, 새로고침(전체 동기화) 검색엔진 상태의 검색엔진 시작·정지와 개별 제어 다른 화면의 [시스템 적용]·[검색 서비스에 적용] |
| 그 컬렉션이 실행 중이면 | 해당 컬렉션의 이름(ALIAS) 수정, 수집 설정·색인 설정 저장 |
| 전체 수집·색인·실행으로 시작한 작업이 남아 있으면 | 컬렉션 추가 |
대기 중과 SNS 선행수집도 잠금 대상입니다
실행이 시작되기 전 대기중 상태도 잠금에 포함됩니다.
SNS 수집을 사용하는 컬렉션은 DB 수집에 앞선 SNS 선행수집 단계도 잠금 대상입니다.
목록의 상태 열이 준비 완료로 돌아오면 잠금이 풀립니다.
설정을 바꾸려면 실행이 끝나기를 기다리거나, [구동 상태] 탭에서 [중지]로 작업을 멈춘 뒤 진행하세요.
6. 권한·라이선스¶
- 관리자: 컬렉션 추가·수정·삭제, 수집·색인·SNS 설정, 수집·색인 실행, 스케줄 등록을 모두 할 수 있습니다.
- 일반: 목록과 상세 탭을 읽을 수 있습니다.
저장·삭제·실행 버튼은 비활성화되거나 보이지 않습니다. - 라이선스: 만료 시 검색과 수집·색인 기능이 제한될 수 있습니다.
자세한 설명은 권한과 라이선스를 참고하세요.