데이터·방법
데이터와 산출 방법
GitHub 저장소
이 사이트의 소스 코드, 집계 데이터, 임팩트 측정 보고서와 보고서 데이터는 모두 GitHub 저장소 ArchivelabEdu/ecoarchive-impact2026에 공개되어 있습니다.
| 폴더 | 내용 |
|---|---|
| data/holdings/ | 이 사이트의 집계 JSON 17종과 보드게임 카드 덱(cards.json, photo_cards.json). 아래 표의 파일과 같습니다. |
| data/impact/ | 임팩트 측정 보고서(v1.0)의 원자료(xlsx)·가공 데이터(CSV)·그림·스크립트. 설명은 폴더 안 README. |
| report/ | 임팩트 측정 보고서 PDF(v1.0, 82쪽) |
| scripts/ | Omeka API 수집·집계·사이트 생성 스크립트(Python) |
| games/ | 보드게임 5종(HTML 한 파일씩)과 썸네일 |
| Releases | Omeka 전수 원본(omeka_items_full.jsonl.gz) |
사이트는 main 브랜치의 docs/ 폴더를 GitHub Pages로 배포합니다. 데이터를 쓸 때는 저장소 README의 이용 조건(집계 데이터 CC BY 4.0)을 따라 주세요. 오류 제보나 제안은 저장소 이슈로 남겨 주시면 됩니다.
데이터 내려받기
이 사이트의 모든 그래프는 아래 JSON에서 그려집니다. 라이선스 CC BY 4.0(집계 데이터). 원자료의 저작권은 각 기증주체와 재단법인 숲과나눔에 있으며 풀숲 이용약관을 따릅니다.
| 파일 | 내용 |
|---|---|
| pulsoop-impact-report-2026-v1.0.pdf | 환경아카이브 풀숲·환경사진아카이브·공간풀숲 임팩트 측정 보고서 v1.0 (PDF, 82쪽, 5.2MB, 2026-10-01 발행) |
| summary.json | 핵심 수치 |
| holdings.json | 유형·형태·연도·주제·지역·품질·등록 추이 |
| collections.json | 컬렉션 34개 상세(유형·연도·주제·지역·키워드·생산자·품질·예시) |
| keywords_windows.json | 5년 단위 상위·특징 키워드 |
| keywords_series.json | 상위 400 키워드의 연도별 건수 |
| keywords_life.json | 키워드 등장·정점·퇴장 |
| keywords_change.json | 연대 간 급상승·급락 |
| keywords_cooc.json | 공출현 네트워크 |
| keywords_dict.json | 키워드 사전(3건 이상) |
| org_keywords.json | 단체 × 공통 키워드 |
| network.json | 생산자→기증주체, 공공기관 문서 |
| events.json | 사건 47건 |
| orgs.json | 조직 전거 542건 |
| chronology.json | 연표 집계 |
| photos.json | 작품사진 집계 |
| season.json | 생산 월 분포 |
산출 방법
수집
- 환경아카이브 풀숲 Omeka Classic 3.0.3 REST API(
/api/items,per_page=50)로 2026-09-10에 전수 111,106건을 수집했습니다. 컬렉션·아이템유형·전시 메타데이터도 함께 받았습니다. - 각 아이템의 Dublin Core·Item Type Metadata 요소를 평탄화해
omeka_items_full.jsonl.gz로 보관합니다(GitHub Releases).
기본 단위
- 비율 지표는 특별한 언급이 없으면 공개된 기록-일반 82,023건 기준입니다. 정보사전(연표·조직·사건·사진작가)과 작품사진은 별도로 집계합니다.
- 생산연도는
Year of Creation→Date of Creation→Dublin Core:Date순으로 앞 4자리를 취했고, 1900~2026 범위 밖은 제외했습니다.
키워드
Keyword요소를;와,로 분리하고 태그를 합친 뒤 중복을 제거했습니다.- 상위·특징 키워드 분석에서는 한겨레 컬렉션을 제외했습니다. 지면 분류(정치·경제·문화·과학)가 키워드로 등록되어 1990년대 상위권을 왜곡하기 때문입니다. 컬렉션명, '환경'·'사회'·'환경운동' 같은 범용어, 숫자가 포함되거나 10자를 넘는 키워드도 제외했습니다.
- 특징 키워드는 (구간 내 출현 비율) ÷ (전체 출현 비율)이 큰 순서이며, 구간 25건(연대 30건) 이상만 대상입니다.
- 급상승·급락은 인접 연대 간 점유율의 log₂ 비율이며, 어느 한쪽 연대에 30건 이상인 키워드만 포함합니다.
- 공출현 네트워크는 상위 150개 키워드 사이에서 같은 기록에 함께 붙은 횟수를 셌습니다.
지역
- 풀숲에는 지역 필드가 없습니다. 키워드·태그·촬영지에서 17개 시도명과 주요 현장 지명 90여 개(새만금→전북, 매향리→경기, 온산→울산, 가리왕산→강원, 강정→제주 등)를 찾아 시도로 매핑했습니다. '광주'는 광주광역시로, '한강'은 서울로 처리했고 낙동강·지리산·4대강처럼 여러 시도에 걸친 지명은 제외했습니다.
- 기록-일반은 7.5%만 식별되므로 모든 지역 그래프는 "식별된 기록 중 분포"입니다.
외부 생산·공공기관
- 생산자(
Dublin Core:Creator) 첫 값을 대괄호·공백을 제거해 컬렉션명과 비교하여 다르면 "외부 생산"으로 보았습니다. "환경운동연합"과 "서울환경운동연합"처럼 지부·전신은 외부로 잡히므로 상한 추정입니다. - 공공기관은 생산자 이름이 부·처·청·원·시·도·군·구·위원회·공사·공단·국회·의원·연구원·진흥원으로 끝나면서 연합·연대·모임·센터·협의회·네트워크·시민·환경운동을 포함하지 않는 경우로 추정했습니다.
컬렉션 유사도
- 컬렉션별 키워드 빈도 벡터의 코사인 유사도입니다.
재현
scripts/omeka_api_pull.py→scripts/omeka_full_build.py→scripts/site_data.py→scripts/build.py. Python 3.9+, pandas, jinja2, markdown.