Info > Data Mining > 3-1. DM and DW > 메타 데이터
▷▶ 메타 데이터
개요
□ 메타 데이터(matadata)
○ 데이터에 관한 데이터
○ 최근 네트웍 기술과 함께 컴퓨터 시스템의 복잡도가 급증하면서 중요성이 새롭게 대두
○ 메타 데이터는 성공적인 데이터 웨어하우스 구축의 열쇠
메타 데이터의 역할
□ 메타 데이터 데이터 생존 주기(data lifecycle)전체에 관련
○ 원천(source) 데이터 수집
○ 데이터 웨어하우스 내에 저장, 가공, 검색, 보급, 교환, 폐기
□ 운영 환경
○ 소프트웨어 개발자나 데이터베이스 관리자에게 매우 귀중한 자료
○ 최종 사용자는 데이터베이스에 정보가 어떻게 들어 있는지 알 필요가 없음
○ 응용 프로그램이 제공하는 화면과 인터페이스 형태에 종속된 단순 작업을 반복
□ 정책 결정을 지원하기 위한 환경
○ 최종 사용자인 데이터 분석가는 데이터 사이에 상관관계 정리
○ 새로운 유용한 정보들을 발견
□ 사용자가 데이터 웨어하우스를 효과적으로 사용하기 위해 메타 데이터는 정확, 최신의 것
데이터 웨어하우스의 메타 데이터
□ 데이터 웨어하우스의 두 가지 작업
○ 구축을 위한 메타 데이터
▶ 데이터 추출, 변환, 통합 작업
▶ 운영 시스템에서 데이터를 추출
▶ 적당한 변환 작업을 거쳐 통합하는 작업
○ 활용을 위한 메타 데이터
▶ 데이터 분석과 질의 처리
▶ 구축된 데이터 웨어하우스에서 사용자의 질의에 따라 데이터를 분석하고 처리
구축을 위한 메타 데이터
□ 개념 : 구축을 위한 메타 데이터는 운영 시스템에서 데이터 웨어하우스로
데이터가 유입되는 동안 거치는 작업들에 관한 정보
○ 이 작업은 매우 복잡
○ 데이터 웨어하우스를 설계하고 구현하는 노력의 80%를 바로 이 작업에서 소비
□ 작업이 어려운 이유
○ 데이터 추출 작업의 복잡성에 기인
▶ 하나의 추출 작업은 몇 단계의 처리 단계로 이루어져 있음
▶ 각 단계는 각기 다른 책임 소재를 가짐
○ 데이터의 원천과 데이터 웨어하우스 내의 테이블과의 대응이 다-대-다(many-to-many)관계
▶ 운영 환경의 데이터가 주제중심(subject-oriented)의 데이터 웨어하우스의 테이블로 옮겨지는 과정은 다수의 임시화일과 변형 프로그램들을 통하여 다-대-다 대응
□ 구축을 위한 메타 데이터는 데이터의 원천과 목표 테이블간의 대응 정보와
각 작업 단계별 변환 알고리즘 등의 정보를 가지고 있어야 함
□ 필수적인 메타 데이터
○ 이벤트 스케쥴링
▶ 시간 주기적 이벤트, 미리 정의된 비주기 이벤트, 관리자에 의한 임의적 이벤트 등의 시작 조건들을 관리
○ 여과 작업의 기준
▶ 추출 데이터의 유용성 여부를 판단할 기준이 필요
활용을 위한 메타 데이터
□ 개념 : 활용을 위한 메타 데이터는 데이터 웨어하우스의 자체 관리와
사용자를 지원하기 위한 정보를 포함
□ 활용을 위한 메타 데이터를 세 개의 계층을 구분
○ 데이터 웨어하우스의 관리를 위한 메타 데이터
○ 질의 처리 지원을 위한 메타 데이터
○ 사용자 지원을 위한 메타 데이터
□ 데이터 웨어하우스의 관리를 위한 메타 데이터
○ 데이터 웨어하우스 자체를 관리하기 위한 메타 데이터
○ RDB에서 카탈로그 시스템을 확장한 것으로 볼 수 있음
○ 메타 데이터는 데이터 웨어하우스의 데이터로 저장
▶ 데이터 모델을 이루는 개체(entity)
▶ 개체간 관계(relationship)
▶ 개체의 속성(attribute)
□ 주요 개체와 데이터 모델의 대응
○ I/O객체 개체-데이터 모델의 개체(entity)에 대응
○ 관계성 개체-데이터 모델의 관계(relationship)에 대응
○ 객체 속성 개체-데이터 모델에서 개체가 갖는 속성(attribute)에 대응
□ 개체와 속성들에 대한 내용
○ I/O객체 개체-데이터 모델 개체에 관한 데이터를 튜플로 갖는 테이블
▶ I/O 종류-객체의 논리적/물리적 종류에 관한 데이터 → 테이블, 문서화일,
코드화된 파일
▶ 상태-때때로 동일한 데이터 웨어하우스의 각 부분들이 상이한 개발 단계 → 테이블은
'설계중', '시험중', '활성', '비활성' 등으로 분류
▶ 책임소재(stewardship)-데이터 웨어하우스는 통합적 속성 때문에 특정 부서나 업무
팀에만 소속되지 않음 → 각 데이터 집합의 제공자를 식별하여, 조사와 오류수정 등이
적합한 팀에 의해 이루어지도록 하는 일이 필요
▶ 저장기간-데이터가 웨어하우스 내에 유지되는 시간에 관한 데이터
□ 질의 처리 지원을 위한 메타 데이터
○ 데이터 웨어하우스는 질의 성능의 향상을 목적으로 다단계 요약 데이터를
가짐
○ 요약 데이터 탐색기는 다단계 요약 데이터를 갖는 데이터 웨어하우스 환경의 필수적인
구성 요소
□ 개체간의 유도 관계를 저장하기 위한 골격 스키마
○ 요약 단계
▶ 개체에 포함된 데이터의 요약된 정도를 식별하는 데이터이다.
○ 요약 알고리즘
▶ 다수의 원천 데이터에서 유도 데이터를 얻는 과정에 사용되는 데이터 변환 알고리즘
○ 요약 속성
▶ 그룹핑(grouping)과 집계(aggregate)작업에 사용된 속성들과 그 밖의 변수들을 정의
○ 사용 패턴
▶ 데이터 웨어하우스에 접근하는 패턴을 기록
▶ 성능을 최적화하고 튜닝(tuning)하는데 매우 유용
▶ 사용 빈도가 낮은 데이터는 값싼 저장 매체에 옮김
▶ 요구가 많은 데이터에 대해서는 접근 속도의 향상
○ 용량 측정 정보
▶ 시간과 자원의 측면에서 질의에 드는 비용을 계산하는 정보
▶ 용량 측정 정보에는 줄(row)수, 증가율, 사용 성향적 특징, 인덱싱 등을 포함
□ 사용자 지원을 위한 메타 데이터
○ 분석자들이 원하는 정보
▶ 데이터 웨어하우스가 어떤 테이블과 속성, 키값들을 포함하고 있는가
?
▶ 이러한 데이터들의 출처는 어디인가 ?
▶ 그 데이터를 얻기 위해서 사용된 변환 방법(transformation logic)은 무엇인가 ?
▶ 이 데이터는 얼마나 자주 재적재(reload)되는가 ?
▶ 별명(alias), 용어 설명, 입력 질의의 수행 가능 여부의 정보
○ 데이터 웨어하우스는 위의 요구 사항을 충족하기 위한 메타 데이터 탐색기를 제공
○ 메타 데이터 탐색기
▶ 브라우징(browsing)
▶ 탐색(searching)
○ 사용자를 위한 설명과 별명, 코드화/참조를 가짐
▶ 설명 : 메타 데이터는 각 개체와 릴레이션, 변화함수 등에 대해 업무상의
의미로 풀어서 설명해 주는 데이터
▶ 별명 : 별명은 데이터 웨어하우스를 보다 더 사용자에게 친숙하게 만들어 주는 구실
▶ 코드화 데이터/참조 테이블
· 데이터를 코드화(encoding)시켰을 경우, 외부 테이블에 참조 데이터를 제공하여 일반적인
해석 내용을 사용자가 알 수 있도록 함
· 참조 테이블의 내용은 코드화된 정보에서 원래의 코드화되지 않은 정보로 복귀 가능함을
보장
▶ 처리시간 추정 : 데이터 웨어하우스 프로젝트가 실패하는 가장 중요한 이유 중에 하나가
질의의 처리시간이 유효한 시간보다 훨씬 많이 걸렸을 때, 사용자들의 욕구불만에 기인한다.
사용자들이 특정 질의가 필요로 하는 시간을 미리 알 수 있다면, 그러한 시간 지연에 대해
인내심을 가질 수 있을 것이다. 데이터 웨어하우스의 성공을 위해서, 질의가 필요로 하는
자원과 시간의 양에 대한 통계적 정보를 갖는 것이 바람직함
요 약
□ 데이터 웨어하우스는 정보 시스템의 중심적 역할
□ 데이터 웨어하우수는 의사 결정 지원을 목적
○ 기업 활동 분석에 필요한 데이터를 과거로부터 축적 및 유지
○ 데이터의 생성 시간을 명시적으로 기록
○ 데이터에 대한 분석은 여러 차원을 근거
○ 차원 분석과 함께 데이터를 효과적으로 관리하려면 차원 모형의 스키마를 사용
□ 데이터 웨어하우스에 대한 사용자의 질의
○ 사용자의 관점에서 데이터를 검색 및 분석
□ 차원 모형
○ 사용자 중심으로 중요한 데이터와 그들에 대한 보조 데이터 등으로 구별
○ 사용자가 중요한 데이터를 직관적으로 구별 가능
○ 테이블을 업무상의 변화하는 중요한 수치를 갖고 있는 테이블과 이에 대한 고정적인
설명을 포함하는 테이블로 구분
▶ 스키마를 이해하기가 쉬워서 사용자가 질의를 쉽게 작성
메타 데이터의 최근 연구 방향
○ 메타 데이터 저장소
▶ 최근의 대부분의 메타 데이터 도구나 저장소(repository)는 관계형 구조에
의존
▶ 객체지향 기술은 데이터 웨어하우스 구축과 실제 통합된 메타 데이터 모델을 위해 보다
더 탄력적인 환경을 제공할 수 있는 잠재적 가능성
▶ 이벤트 처리 방식을 지원하기 위해서 액티브(active)데이터베이스의 기능의 필요성이
발생
▶ 액티브 관계형 데이터베이스에 적합한 메타 데이터 모델링 연구도 병행
○ 데이터 통합(integration)과 메타 데이터 재사용
▶ 조직 내의 모든 데이터베이스와 데이터 웨어하우스의 통합적 이용을 위해서 메타 데이터들의 공통 성향을 찾고 메타 데이터의 재사용 기회를 높이려는 연구 진행
○ 메타 데이터 탄력성(scalability)
▶ 데이터 웨어하우스가 성장함에 따라 발생하는 여러 변화에 대해 탄력적으로
대처할 수 있는 메타 데이터 모델
▶ 메타 데이터의 탄력성을 보장하는 요구 사항을 정의
▶ 적합한 모델링 방법을 제시하기 위한 연구
○ 메타 데이터 교환(interchange)을 위한 표준(standard) 표기법
▶ 메타 데이터의 특징은 비표준성
▶ 메타 데이터의 공유를 위해서 교환을 위한 표준안의 필요성이 대두
Info > Data Mining > 3-1. DM and DW > 메타 데이터