[데이터 엔지니어링 디자인 패턴] 08. 데이터 스토리지
데이터 엔지니어링 디자인 패턴 시리즈의 글입니다.
READ ↗TAGGED NOTES
데이터 수집, 저장, 처리와 데이터 시스템 관련 포스트
28 POSTSBROWSE THE ARCHIVE
데이터 엔지니어링 디자인 패턴 시리즈의 글입니다.
READ ↗데이터 엔지니어링 디자인 패턴 시리즈의 글입니다.
READ ↗데이터 엔지니어링 디자인 패턴 시리즈의 글입니다.
READ ↗데이터 엔지니어링 디자인 패턴 시리즈의 글입니다.
READ ↗데이터 엔지니어링 디자인 패턴 시리즈의 글입니다.
READ ↗데이터 엔지니어링 디자인 패턴 시리즈의 글입니다.
READ ↗데이터 엔지니어링 디자인 패턴 시리즈의 글입니다.
READ ↗데이터 엔지니어링 디자인 패턴 시리즈의 글입니다.
READ ↗데이터 중심 애플리케이션 설계 시리즈의 글입니다.
READ ↗데이터 중심 애플리케이션 설계 시리즈의 글입니다.
READ ↗데이터 중심 애플리케이션 설계 시리즈의 글입니다.
READ ↗데이터 중심 애플리케이션 설계 시리즈의 글입니다.
READ ↗데이터 중심 애플리케이션 설계 시리즈의 글입니다.
READ ↗데이터 중심 애플리케이션 설계 시리즈의 글입니다.
READ ↗데이터 중심 애플리케이션 설계 시리즈의 글입니다.
READ ↗임시테이블 (raw data 저장)테이블 생성CREATE EXTERNAL TABLE test.eaxmple_table(date string, data string)ROW FORMAT DELIMITEDFIELDS TERMINATED BY ','LINES TERMINATED BY '\n'LOCATION '/test/db/eaxmple_table'TBLPROPERTIES ('skip.header.line.count'='1');
READ ↗애증의 zeppelin.. 이쁘게 시각화해주는데 spark랑 찰떡궁합이어야하는놈이 왜이리 삐걱거리는지 고생을 많이 시켰다. 삽질내용 정리해보았다.
READ ↗구축한 hadoop ecosystem에 zeppelin을 추가해보자.zeppelin은 hadoop에 밀어넣은 데이터를 spark로 분석하고 시각화해주는 역할을 할 것이다.
READ ↗sqoop은 RDBMS to HADOOP 혹은 HADOOP to RDBMS를 쉽게 해주는 어플리케이션이다.이러한 sqoop을 어떻게 설치하고 어떻게 실행하는지 알아보자.
READ ↗여러 서버에 spark 설치하고 데이터를 분석하려면 spark를 클러스터로 묶어줘야한다.아래와 같이 각 서버의 spark 환경설정파일을 수정하면 여러대의 spark를 cluster로 묶을 수 있다.(반드시 묶고자하는 모든 서버의...
READ ↗빅데이터 분석 플랫폼으로 일컬어지는 플랫폼은 매우 여러개가있다. 그리고 무척 많은 카테고리로 나뉘어진다. 수집, 저장, 분석, 시각화..이게 분류도 많고 종류도 많고 자꾸 헷갈려서 대략적으로 각...
READ ↗hadoop에서 특정 datanode만 다운되는 경우가있다.그럴때 특정 datanode만 start하려면 sbin폴더로 가서 아래 명령어를 사용한다.
READ ↗하둡에서 자주 사용하는 명령어는 다음과 같다.
READ ↗python spark wordcount 해보기
READ ↗standalone으로 hadoop 설치시 설정값서버 1대에 namenode, datanode 모두 한대씩만 standalone으로 hadoop 설치할때 config 모음
READ ↗HDFS에서 Block이 어떻게 읽고 쓰여지고 이동하는지, Block의 상태변경에 대해 알아보자.
READ ↗HDFS 의 구성요소를 알아보자
READ ↗Hadoop & Spark 설치
READ ↗