연구
14편
- 2024
- 2024.05무작위 샘플링은 정말 무작위인가 — Next-POI 추천의 네거티브 샘플링 (WWW'24)
학습이 진행되면 random negative sampling이 사실상 easy negative sampling으로 퇴화한다는 관찰에서 출발해, Degree of Positiveness 기반 2단계 hard negative 샘플러를 제안하고 SOTA 다섯 모델 × 세 데이터셋 × 네 지표 60개 조합 전부를 향상시킨 연구
석사 연구 · 국제 학회 논문 (공동 제1저자) · 2022.06 – 2024.05
- 2023
- 2023.05사전 학습 모델로 하드 네거티브 POI를 찾는다 — 체크인 시퀀스 기반 next POI 추천의 네거티브 샘플링 (ASK'23, 제1저자·우수논문상)
랜덤 샘플링으로 사전 학습한 별도 모델의 예측점수를 사분위로 나눠 2·3·4분위에 +5/10/15%의 샘플링 확률을 주고, 10km 초과 POI를 후보에서 제외한 뒤 warm-up 이후부터 적용해 STAN의 recall@5를 NYC 16.4%, TKY 7.8% 끌어올린 예비 연구
석사 연구 · 국내 학술대회 논문 (제1저자) · 2023.03 – 2023.05 (ASK 2023 발표 2023.05.19)
- 2022
- 2022.06차량 운전자의 내비게이션 사용 이력 데이터셋을 활용한 개인화 POI 추천 시스템 (KCC'22)
체크인이 아닌 '목적지 설정' 로그로 운전자를 위한 POI 추천 문제를 정의하고, SAE-NAD를 피드백 가중 학습과 그룹 인기도 재랭킹으로 확장해 Recall@5를 최대 15.7% 개선한 연구
석사 연구 · 국내 학술대회 논문 · 2022.06 발표 (선행 산학 과제 2021.08 – 2022.03)
- 2022.03현대자동차 VCRM 데이터 분석을 통한 커넥티드 카 서비스 기획
내비게이션 로그 2억 2,899만 행에서 출발해, 차량 운전자 전용 개인화 POI 추천 모델과 웹 데모까지 만든 8개월
산학과제 · 2021.08 – 2022.03 (8개월)
- 2021
- 2021.01고유얼굴(Eigenface) — 주성분에 이름을 붙이고, 가장 잘 맞은 사진을 의심했다
Yale 데이터베이스에 직접 수집한 사진을 더해 2,738장을 만들고 SVD·PCA를 구현해, 안경은 6번·수염은 16번 주성분에 실린다는 것을 데이터를 바꿔 넣어 확인한 수치해석 중간과제
수치해석 계절학기 중간과제 · 개인 · 2021.01 (수치해석 계절학기)
- 2020
- 2020.12유방암 조직병리 이미지 인식 — 모델을 키우는 대신, 병리학자가 보는 곳을 이미지에 세웠다
8클래스 테스트 정확도 0.12에서 시작해, 층 깊이·구조·전처리를 한 번에 하나씩만 바꿔 40배율 0.9808까지 올리고 Grad-CAM으로 근거를 확인한 종합설계 연구
학부 팀 프로젝트 · 산업공학 종합설계 2 · 2020 (보고서 최종본 2020.11.15)
- 2020.06훈련되지 않은 필기 한자 인식 — 글자 대신 부건(部件)을 검출한다
학습셋에 없던 한자를 읽기 위해 글자 전체가 아니라 부건을 객체로 검출했다. 부건의 평균 이미지에서 Haar-radical stump를 직접 만들어 AdaBoost로 묶었고, 부건 4종에서 평균 IoU 0.3795–0.6692를 얻었다
학사학위논문 · 산업공학 종합설계(PBL) · 2020.03 – 2020.06
- 2019
- 2019.12컨베이어벨트 수명분포 추정 — 고장 시각을 모르는 데이터로 수명을 추정한다
일정 간격으로만 고장을 확인한 HRSS 컨베이어 로그에서 구간관측중단 구간을 직접 뽑아내고, CDF의 차이로 쓰는 구간관측중단 로그우도를 손으로 코딩해 MLE로 와이블 모수를 추정했다
학부 개인 프로젝트 · 신뢰성공학 · 2019.12 (문서 최종 수정 2019-12-16)
- 2019.11빅데이터 분석 경진대회 — 3시간짜리 현장 분석을 두 소프트웨어로 두 번씩 풀었다
성인 연간 수익 분류와 복합화력발전소 전력 생산량 예측 두 문항을 보고서가 정한 6단계 절차로 풀고, JMP와 EC Miner에서 같은 모형을 각각 돌려 결과를 대조한 기록
빅데이터 분석 경진대회 · 한양대학교 스마트팩토리랩 · 2019.11.13 – 2019.11.20
- 2019.06HRSS 컨베이어 고장 예측 — 정확도 0.978이 나왔을 때 의심부터 했다
초 단위로 불균일하게 기록된 18개 속성의 창고 컨베이어 로그에서, 반복 기록된 중복 행이 만든 데이터 누수로 부풀려진 0.978을 0.772로 되돌린 기록
학부 개인 프로젝트 · 빅데이터 마이닝 · 2019.05 – 2019.06
- 2019.06콘크리트 압축강도 회귀분석 — 계수를 뽑는 시간보다 그 계수를 믿어도 되는지 확인하는 데 더 썼다
재료 7종과 경화 시간으로 압축강도를 설명하는 다중회귀를 세우고, 네 가지 기본가정을 모두 검정한 뒤 이상치 절단·마할라노비스 거리·로그변환으로 세 번 교정하고 10겹 교차검증까지 돌린 기록
학부 팀 프로젝트 · 통계적 모델링 (3인) · 2019.05 – 2019.06
- 2018
- 2018.12신차 판매량 예측 — 헤드램프와 시트 재질까지 변수로 넣으면 무엇이 남는가
카탈로그 사양 51개를 변수로 만들어 회귀와 랜덤포레스트로 신차 판매량을 예측했고, 정작 출발점이었던 리콜은 상관계수 −0.05로 끝났다
학부 팀 프로젝트 · 응용통계학 · 2018.11 – 2018.12
- 2018.12배송 최적경로 — '최단거리 = 최소비용'을 의심하고 간선 가중치를 다시 설계했다
서울시청 부근 배송망을 정점 5개·간선 7개의 가중 그래프로 놓고, 거리 대신 실시간 교통정보의 소요시간을 가중값으로 삼아 최소비용 신장트리를 구한 데이터구조론 과제 기록
학부 개인 과제 · 데이터구조론 · 2018.09 – 2018.12
- 2018.06수능 정답률 분석·예측 — 데이터가 없으면 2,416문항을 직접 만든다
2010–2018년 수능·6월·9월 모의고사 2,416문항을 손으로 읽어 변수로 바꾸고, SPSS 다중회귀로 국어·영어 정답률을 설명해 본 기록
학부 팀 프로젝트 · 확률과통계 (2018-1) · 2018.03 – 2018.06