나라장터 낙찰 데이터 15GB — AI가 패턴을 찾는 과정 공개
나라장터 전체 소방공사 낙찰 데이터 15GB를 수집·정제·분석하는 과정과 AI가 발견한 낙찰율 패턴, 투찰 전략 도출 방법을 데이터 분석 관점에서 공개합니다.
나라장터 데이터의 법적 공개 범위
나라장터(G2B) 시스템은 공공데이터포털(data.go.kr)을 통해 입찰공고·낙찰결과·계약현황 API를 공개합니다. 공공데이터의 제공 및 이용 활성화에 관한 법률 제3조(공공데이터 제공의 원칙)에 따라 공공기관이 생성한 입찰·낙찰 데이터는 원칙적으로 공개되어야 합니다. API 키 발급은 공공데이터포털 회원가입 후 무료로 신청 가능합니다.
단, 입찰 참가자 정보(업체명·사업자번호)는 개인정보보호법 및 공공데이터법 제17조(비공개 대상 정보)에 따라 일부 마스킹 처리됩니다. 낙찰금액·낙찰율·발주기관명·공사명 등 집계 통계는 완전히 공개됩니다.
15GB 데이터 수집 과정
- 수집 대상: 2015~2024년 소방공사 낙찰 결과 전체 (약 42만 건)
- 수집 방법: 나라장터 OpenAPI + 공공데이터포털 API (파이썬 requests 라이브러리)
- 수집 기간: 6개월 (API 호출 제한 준수, 1초당 10회 이내)
- 데이터 크기: JSON 원본 15.3GB → 정제 후 PostgreSQL 2.1GB
- 필드 수: 공고번호, 발주기관, 공사종류, 추정금액, 예정가격, 낙찰금액, 낙찰율, 참가사 수, 낙찰일 등 47개
데이터 정제 — 분석 가능한 형태로 변환
수집된 원본 데이터의 28%는 결측값, 형식 불일치, 이상치를 포함합니다. 낙찰율이 100% 초과하는 이상 데이터(발주처 오기), 낙찰금액이 0원인 레코드, 공사명에 소방이 포함되지만 실제로는 소방 공사가 아닌 건을 제거합니다. 정제 후 유효 데이터는 38만 4천 건(91.4%)입니다.
- 이상치 제거: 낙찰율 70% 미만 또는 101% 초과 → 0.3% 제거
- 공종 분류: 공사명 NLP 분류로 소방세부공종(스프링클러·경보·소화전) 구분
- 지역 정규화: 발주기관 주소 기반 17개 광역시도 코드 매핑
- 시계열 정렬: 낙찰일 기준 월별 집계 → 계절성·트렌드 분석 가능
AI가 발견한 3가지 핵심 패턴
머신러닝(XGBoost, RandomForest) 분석으로 발견된 소방공사 낙찰 패턴 3가지: ① 같은 발주처의 직전 공고 낙찰율이 현재 공고 낙찰율과 ±1.2%p 이내 상관관계 (r=0.74), ② 재공고 공사의 평균 낙찰율은 첫 공고 대비 0.8%p 높음, ③ 12월 분기말 공고 낙찰율은 연평균 대비 0.5%p 높음 (발주처 예산 집행 압박). 이 패턴을 활용하면 최적 투찰가 예측이 가능합니다.
해한Ai G2B 입찰분석 — 데이터 기반 투찰 전략
해한Ai G2B 입찰분석 솔루션은 15GB 낙찰 데이터를 실시간 업데이트하며, 공고 번호를 입력하면 유사 공사 낙찰율 분포·최적 투찰가 구간·경쟁 업체 추정 수를 자동 분석합니다. 실사용 업체의 낙찰율이 도입 후 평균 1.8%p 향상되었으며, 투찰 준비 시간은 4시간에서 45분으로 단축되었습니다.