Validation 데이터를 정리하다가, 또는 배치별 수율을 트렌드로 묶다가 "이거 엑셀로 하기엔 너무 반복적인데"라는 생각이 든 적이 있을 겁니다. 시험 결과 수백 건을 필터링하고, 배치마다 스펙 이탈 여부를 확인하고, 그 결과를 그래프로 옮기는 작업은 엑셀로도 되긴 하지만 손이 많이 갑니다. 이럴 때 등장하는 것이 파이썬(Python)과 그 위에서 돌아가는 판다스(Pandas), 넘파이(NumPy), 맷플롯립(Matplotlib)입니다. 문제는 이 넷의 이름과 역할이 뒤섞여서 다가온다는 점입니다. 이 글은 코딩을 전혀 해본 적 없지만 엑셀은 매일 쓰는 QA/CMC 실무자를 기준으로, 네 가지 도구가 각각 무엇을 담당하는지와 실무에서 자주 쓰는 핵심 용어(함수)를 정리합니다. 왜 엑셀에 익숙한 사람도 이 도구들을 알아야 할까 엑셀은 수십, 수백 행 정도의 데이터를 다루는 데는 충분합니다. 하지만 배치가 수천 건 쌓이거나, 매달 같은 형태의 트렌드 보고서를 반복해서 만들어야 하거나, 여러 파일에 흩어진 시험 결과를 한 번에 모아 분석해야 하는 상황에서는 엑셀의 수작업 방식이 병목이 됩니다. 파이썬과 그 라이브러리들은 이 반복 작업을 코드 몇 줄로 자동화하고, 사람이 놓치기 쉬운 필터링·집계 실수를 줄여줍니다. 처음부터 모든 업무를 코드로 옮길 필요는 없고, 반복이 많은 작업부터 하나씩 옮겨보는 정도로 시작하면 충분합니다. 라이브러리란 결국 무엇인가 엑셀에는 이미 만들어진 함수(AVERAGE, VLOOKUP, SUMIF)가 있어서, 그 계산 로직을 처음부터 짤 필요가 없습니다. 파이썬의 "라이브러리"도 정확히 같은 개념입니다. 누군가 미리 짜서 이름을 붙여둔 함수들의 묶음이며, 우리는 그 이름만 알면 가져다 쓸 수 있습니다. 다만 엑셀은 함수가 하나의 프로그램 안에 다 들어있는 반면, 파이썬은 목적에 따라 함수 묶음이 여러 라이브러리로 나뉘어 있다는 점이 다릅니다. 도구 엑셀에 비유하면 주로 담...
바이오·제약 연구자의 실험대 위 생각들을 대나무 마디처럼 하나씩 쌓아 기록합니다. 프로토콜, 밸리데이션, 가끔은 러닝화와 피아노 이야기까지.