전체 글36 [Paper Review] 고비용 공정데이터 결측치 대체 방법 - 궁금증 정리 본 논문을 작성하면서 결측치 대체와 공정 데이터에 관련한 다양한 궁금증을 가졌었는데, 해당 내용들을 정리해보았다. 논문을 이해하는 데에 도움이 되길 바란다.1. CTQ가 무엇인가?이전 포스트에도 작성하였듯이, CTQ(Critical-To-Quality)는 품질 특성치, 즉 어떤 제품의 품질을 결정하는 핵심 요소이다. 이는 해당 제품을 이용하거나 구매하는 고객들이 중요하게 여기는 제품의 품질을 수치로 정의한 품질변수이다. 따라서 CTQ는 측정 가능하도록 숫자로 표현되어야 하며, 제품의 품질을 직접 결정한다는 중요한 특징을 지닌다.이해하기 쉽게 본 논문에서 사용한 시멘트 공정 데이터를 예시로 들어 설명해보도록 하겠다.수집된 공정 데이터에서는 이 CTQ가 종속변수로 작용하며, 시멘트의 품질을 설명하는 CTQ에.. 2026. 2. 22. [Paper Review] 고비용 공정데이터 획득 환경에서 불완비 공정데이터의 효율적인 결측치 대체 방법 - 2 4. 실험내용 및 결과4.1 실험 내용본 연구는 품질특성치 예측에 앞서 18개의 독립변수를 대상으로 결측치 대체 성능을 평가하였으며, 모든 변수가 완비된 451건의 데이터를 활용하였다. 대체 성능 검증을 위해 두 가지 실험을 수행하였는데, Test1은 하나의 변수에만 결측이 발생하는 상황을 가정하여 일부 값을 인위적으로 제거한 뒤 복원 정확도를 비교하였고, Test2는 한 샘플당 1~5개의 결측이 발생하는 보다 복잡한 상황을 설정하여 다양한 결측 패턴에서의 대체 성능을 평가하였다.4.2 실험결과1) 결측치 대체 전후의 데이터 분포 왜곡 여부 검증-> 육안으로 확인했을 때 대체 성능이 비교적 양호한 것으로 확인.2) 실제 결측치가 발생한 위치별로 대체 수행예측값과 실제값의 차이가 임계값 이하일 경우 : ".. 2026. 2. 15. [Paper Review] 고비용 공정데이터 획득 환경에서 불완비 공정데이터의 효율적인 결측치 대체 방법 - 1 본 논문에서는 고비용 데이터 수집 환경에서 수집된 불완비 공정 데이터의 결측값을 대체하는 문제를 다룬다. 여기서 발생하는 각각의 결측값들은 데이터의 완전성, 정확성, 일관성의 부족으로 인해 발생하며, 이는 제조 공정에서 품질특성치(CTQ, Critical-to-Quality attributes)의 품질에 중대한 영향을 미친다. ※ 품질 특성치(CTQ) : 제품이나 공정의 품질을 수치로 나타낸 지표수집한 데이터를 실제 연구에 적용하기 위해서는 적절한 방식으로 결측값들을 대체할 필요가 있다. 따라서 본 연구에서는 다음 세 가지의 기법을 사용하여 결측치 대체 실험을 진행하였다. 1) MICE, 2) 머신러닝 기반 missForest, 3) 딥러닝 기반 1차원 합성곱 신경망(1D-CNN)분석 목적은 노이즈가.. 2026. 2. 15. [딥러닝] AI기반 임신 주수별 약물 섭취 금기 모니터링 서비스 ※ 본 프로젝트는 팀원들과 함께 진행되었으며, 블로그 업로드와 관련하여 팀원들의 허가를 받았음을 알려드립니다.임산부의 복약 문제는 단순히 개인의 건강 차원을 넘어 태아의 생명과 직결되는 중대한 사안이다. 따라서 본 프로젝트에서는 AI를 활용하여 임신 주수별 약물 섭취 금기 여부를 손쉽게 확인할 수 있는 맞춤형 모니터링 서비스를 제안한다.01. 연구의 필요성이번 연구의 필요성은 크게 세 가지 차원에서 설명 가능하다.1) 개인적 차원 : 임산부가 올바른 정보를 바탕으로 복약 여부를 판단하면 불안과 스트레스를 줄이고, 건강한 출산을 가능하게 한다는 점에서 개인적 의의가 크다.2) 사회적 차원 : 의료 정보의 격차는 여전히 존재하며, 사회적 지원이 부족한 임산부일수록 위험이 크다. 이는 출산율과 아동 건강 수준.. 2025. 9. 23. [딥러닝] 텍스트 데이터 분석을 통한 맥주 브랜드별 분석 프로젝트 ※ 본 프로젝트는 팀원들과 함께 진행되었으며, 블로그 업로드와 관련하여 팀원들의 허가를 받았음을 알려드립니다.이번 게시글에서는 지난 1학기에 수강한 '텍스트 데이터 분석' 과목에서 진행한 프로젝트를 소개하려 한다.2023년 국내 맥주 점유율에 따르면, 상위에 있는 국내 맥주 브랜드 다섯 가지가 카스, 테라, 아사히, 켈리, 그리고 클라우드 맥주였다. 본 프로젝트에서는 각각의 맥주를 검색했을 때 나오는 네이버 블로그 데이터를 크롤링하여 여러 가지 방법으로 분석을 진행한 뒤, 유의미한 인사이트를 도출하는 데에 목적을 두었다.01. 데이터 수집 (Data Collection)데이터는 네이버 블로그 API와 Selenium을 활용하여 네이버 블로그 데이터를 수집하였으며, 수집 내용은 아래와 같다.수집 대상: 카.. 2025. 9. 22. [통계] Python에서 MICE를 사용하여 결측치 대체하기 (Scikit-learn의 IterativeImputer) 이번 포스팅에서는 지난 MICE 기초 포스팅 내용에 이어,Scikit-learn의 IterativeImputer를 활용해 MICE(Multivariate Imputation by Chained Equations) 방식으로 결측치를 대체하는 구체적인 내용에 대해 다뤄보도록 하겠다.우선, 필자가 실제 데이터 분석에 사용했던 예시 코드는 아래와 같다.imputer = IterativeImputer(random_state=42)mice_result = imputer.fit_transform(mice_input_df)MICE를 적용하기 위해 간단한 전처리(수치형 + 범주형 데이터 분리, 원핫인코딩 등)를 거친 mice_input_df 데이터에 MICE 방식의 결측치 대체를 적용한 뒤, mice_result라는 변.. 2025. 7. 3. [통계] MICE 결측치 대체법: 다중대입법을 활용한 결측치 대체 본 포스팅에서는 데이터 분석 과정에서 자주 마주치는 '결측치(missing value)' 문제와 이를 다루는 대표적인 방법 중 하나인 MICE(Multivariate Imputation by Chained Equations) 방식에 대해 설명할 예정이다.일반적으로 결측치는 평균값이나 최빈값으로 대체되는 경우가 대부분인데, 이는 변수 간의 관계를 무시한 채 단순히 값을 채워 넣는 방식이기 때문에 데이터의 구조를 왜곡하고 분석 결과에 편향을 초래할 수 있는 문제가 있다.그럼 본격적으로 결측치의 유형과 이를 대체하기 위한 다양한 방법들, 그리고 그 중에서도 MICE 결측치 대체법에 대해서 알아보자.01. 결측치의 유형결측치는 발생 방식에 따라 세 가지 유형으로 나뉜다. 각각의 개념은 결측치가 분석에 미치는 영.. 2025. 6. 28. [paper review] BioBERT: a pre-trained biomedical language representation model for biomedical text mining Abstract 본 연구에서는 일반 도메인 언어 모델인 BERT를 생물의학 분야에 효과적으로 적용하기 위해 BioBERT를 제안한다. BioBERT는 대규모 생물의학 코퍼스에 대해 사전 학습된 BERT 기반 언어 모델로, 별도의 아키텍처 변경 없이 기존 BERT보다 생물의학(biomedical) 텍스트 마이닝 작업(명명 엔터티 인식named entity recognition, 관계 추출relation extraction, 질문 응답question answering)에서 더 뛰어난 성능을 보였다. 특히 F1 점수 및 MRR에서 유의미한 향상을 보이며, 이는 생물의학 코퍼스 기반의 사전 학습이 모델의 이해도를 높이는 데 기여함을 시사한다. BioBERT의 사전 학습 가중치와 파인튜닝 코드는 https://g.. 2025. 5. 14. [자료구조] 자료 구조와 알고리즘 기본 개념 / 시간 복잡도 / 빅오 표기법 01. 자료구조(Data Structure)란?자료구조란, 일련의 동일한 타입의 데이터를 정리하여 저장한 구성체를 뜻한다. 이는 크게 선형 자료구조와 비선형 자료구조 두 가지로 나뉜다.1. 선형 자료구조: 이름 그대로, 선형의 모형을 띄고 있는 데이터로 구성된 자료구조를 의미힌다. 데이터를 한 줄로 나열하여 순차적으로 표현하였으며, 선형 리스트, 연결 리스트, 스택, 큐 등이 이에 속한다.2. 비선형 자료구조: 비선형 모형을 띄고 있는 데이터로 구성된 자료구조를 의미한다. 하나의 데이터 뒤에 여러 개가 이어지는 형태이며, 트리나 그래프 등이 이에 속한다.02. 알고리즘(Algorithm)이란?알고리즘이란, 문제를 "유한한 시간동안" 해결하는 단계적 절차를 의미한다. 만약 무한루프에 걸려 무한한 시간이 걸.. 2025. 4. 17. [슬기로운 인턴생활2] RAID의 개념과 Synology의 SHR 비교 NAS 구매를 위해선 RAID가 무엇인지에 대한 개념적인 이해가 필수적이다. 처음 이해하는 것이 그렇게 쉽지는 않았지만, 이것 역시 한 번 알아두면 나중에 많은 도움이 될 것 같아 정리해보았다.NAS의 기본적인 개념에 대한 공부가 필요한 사람은 이전 게시글을 참고하길 바란다.https://sunnybae1023.tistory.com/31 [슬기로운 인턴생활2] NAS의 기본 개념, 기업별(synology, qnap, iptim 정보, HDD와 SSD 알아보기회사에서 프로젝트를 진행하던 과정에서 대표님께 NAS에 대해 알아보라는 업무를 추가로 받았다.NAS에 대한 정보가 일절 없던 상황에서 자료조사를 하나씩 해보니, NAS는 데이터를 저장하고 보관sunnybae1023.tistory.com 01. RAID.. 2024. 11. 19. [슬기로운 인턴생활2] NAS의 기본 개념, 기업별(synology, qnap, iptim 정보, HDD와 SSD 알아보기 회사에서 프로젝트를 진행하던 과정에서 대표님께 NAS에 대해 알아보라는 업무를 추가로 받았다.NAS에 대한 정보가 일절 없던 상황에서 자료조사를 하나씩 해보니, NAS는 데이터를 저장하고 보관하기에 훌륭한 수단이기에 앞으로도 종종 사용할 것 같아 정리해두려 한다. 그럼 NAS의 기본적인 개념부터, NAS 구매를 위해 알아야 하는 개념들에 대해 좀 더 자세히 알아보자. 01. NAS란?우선 NAS의 기본 개념에 대해 설명하겠다.NAS란 Network Attached Storage의 약자로, 데이터의 저장을 주 기능으로 하는 컴퓨터를 인터넷에 연결하여 언제 어디서나 웹 브아루저 또는 모바일 앱을 통해 손쉽게 접속하여 사용할 수 있게 해주는 장치이다. 아주 쉽고 간단하게 설명하자면 바로 '데이터 저장에 특화.. 2024. 11. 19. [자료구조] 자료구조의 기본 개념 및 종류, 예제 코드 자료구조는 데이터를 효율적으로 저장하고 관리하는 방법을 뜻한다. 컴퓨터 프로그램에서 데이터를 다루기 위해서는 데이터의 크기나 성질, 처리 방식 등에 맞는 자료구조를 선택하는 것이 중요하다. 예를 들어, 데이터를 순서대로 다루어야 하는 경우와, 특정 조건에 맞는 데이터만 빠르게 검색해야 하는 경우에는 각기 다른 자료구조가 더 적합할 것이다. 이렇게 적절한 자료구조를 사용하면 코드의 성능을 높이고, 메모리 사용을 효율적으로 관리할 수 있다.아래에서는 대표적인 자료구조와 각 자료구조의 특징, 사용법, 그리고 코드 예제를 통해 활용 방안을 설명하겠다.1. 배열 (Array)배열은 동일한 데이터 타입을 가진 값들이 연속된 메모리 공간에 저장된 자료구조이다. 배열은 각 요소가 고유한 인덱스를 가지기 때문에, 데이터.. 2024. 11. 5. 이전 1 2 3 다음