콘텐츠로 이동

본문과 메타데이터

스크랩에는 화면 이미지나 아카이브 외에도 본문 텍스트와 원본 정보가 포함될 수 있습니다. 본문은 Markdown으로 추출되어 **본문(MD)**에서 읽을 수 있습니다. 메타데이터는 URL, 저장일, 작성자처럼 자료를 설명하는 정보입니다. 이미지, 본문, 원본 정보는 각각 확인하는 목적이 다릅니다. 저장이 끝나면 필요한 파일과 정보가 실제로 포함되어 있는지 살펴봅니다.

  1. 목록에서 웹스크랩 항목을 선택합니다. 먼저 스크린샷으로 원하는 페이지가 저장되었는지 확인합니다. 제목이나 로그인 안내만 보인다면 본문 파일을 읽기 전에 캡처 결과부터 점검합니다. 이미지가 정상이어도 본문 추출이 반드시 같은 상태인 것은 아닙니다.
  2. 미리보기에서 **본문(MD)**를 선택합니다. 제목, 원본 주소, 본문 텍스트를 읽습니다. 필요한 문단이 들어 있는지 확인합니다. 페이지 메뉴나 반복 문장이 섞여 있다면 캡처 범위를 바꾸어 비교할 수 있습니다. 추출 결과는 원본의 화면 배치를 그대로 보여 주는 형식은 아닙니다.
  3. 상세정보를 엽니다. URL, 저장일, 발행일, 작성자, 사이트 등 표시된 값을 확인합니다. 저장일은 AURORA에 보관한 시점이며 발행일은 원본에서 얻은 정보입니다. 두 날짜가 같아야 하는 것은 아닙니다.
  4. 제목을 알아보기 쉽게 정리하고 저장 이유를 메모에 남깁니다. 원본 사이트가 작성자나 발행일을 제공하지 않으면 해당 정보가 비어 있을 수 있습니다. 비어 있는 값을 임의로 원본 사실이라고 채우기보다 확인 가능한 내용을 메모로 구분해 기록합니다.
  5. 폴더 열기를 눌러 실제 파일을 확인합니다. 저장 방식에 따라 이미지, PDF, 아카이브, 본문 파일이 함께 있을 수 있습니다. 선택하지 않은 형식이나 생성에 실패한 형식의 파일이 반드시 존재하는 것은 아닙니다.
  6. 영상이 포함된 항목은 재생 상태를 따로 확인합니다. 실제로 내려받은 파일을 열어 필요한 영상과 소리가 재생되는지 확인합니다. 오프라인 보존 품질은 아래 기준처럼 전체 재생, 일부 재생, 재생 불가로 구분해서 판단할 수 있습니다. 현재 화면에 품질 배지가 항상 나타나는 것은 아니므로 직접 재생을 확인합니다.
파일 또는 정보 역할 확인 방법
screenshot.png PNG 화면 이미지 스크린샷 미리보기로 범위 확인
screenshot.jpg JPG 화면 이미지 글자 선명도와 크기 확인
page.pdf 인쇄용 문서 PDF의 페이지 나눔 확인
page.mhtml 페이지 아카이브 HTML 보기 또는 파일 열기
page.html 단일 HTML 또는 선택 영역 HTML 실제 포함된 내용과 리소스 확인
content.md 추출한 Markdown 본문 본문(MD)에서 내용 읽기
썸네일 파일 목록의 대표 이미지 목록에서 항목 구분
URL 원본 주소 원본 URL 또는 URL 복사
저장일 AURORA에 저장한 날짜 상세정보에서 확인
발행일과 작성자 원본이 제공한 정보 원본 페이지와 대조

워크스페이스에는 목록과 분류 정보를 관리하는 데이터베이스와 실제 저장 파일이 있습니다. 항목별 저장 폴더 안에는 생성된 형식의 파일이 들어갑니다. 폴더를 찾을 때에는 파일 이름을 추측해 검색하기보다 앱의 폴더 열기를 사용합니다. 워크스페이스 전체 위치는 저장 폴더 열기로 확인합니다.

원본 정보가 모두 metadata.json이라는 파일 하나에 보관된다고 가정하지 않습니다. 현재 자료의 URL, 날짜, 제목과 분류 정보는 앱의 상세정보에서 확인합니다. 폴더에 metadata.json이 없다는 이유만으로 스크랩 실패라고 판단하지 않습니다. 이미지와 본문 파일이 열리는지, 항목 정보가 목록에 표시되는지를 함께 확인합니다.

파일 이름은 저장 경로나 항목 종류에 따라 달라질 수 있습니다. 가져온 파일, 사진첩, 콘텐츠, 영상은 웹페이지 스크랩과 다른 구성을 사용할 수 있습니다. 워크스페이스를 보관하거나 다른 위치로 옮기려면 항목 파일 하나만이 아니라 목록 정보와 관련 파일의 관계를 고려해야 합니다. 앱의 워크스페이스와 동기화 기능 안내를 먼저 확인합니다.

Markdown은 글의 내용을 텍스트 중심으로 읽기 위한 형식입니다. 스크립트나 메뉴 같은 요소를 제거하는 과정에서 원본과 순서가 달라지거나 일부 내용이 빠질 수 있습니다. 페이지가 이미지로만 본문을 제공한다면 추출할 글자가 적을 수 있습니다. 이 경우 스크린샷을 확인하고 필요한 글자는 OCR로 읽습니다.

콘텐츠 범위로 저장했다면 자동 감지한 본문을 중심으로 텍스트가 만들어질 수 있습니다. 전체 페이지를 저장하면 더 많은 주변 문장이 포함될 수 있습니다. 제목과 핵심 문단을 찾을 수 있는지 확인한 뒤 읽기 용도로 사용합니다. 공식 문장이나 수치를 인용할 때에는 원본 이미지 또는 원본 페이지와 대조합니다.

확인 결과 의미 다음 확인
전체 재생 가능 미디어를 로컬에서 재생할 수 있는 상태 실제 필요한 영상을 재생합니다
일부 재생 가능 미디어 중 일부만 재생 가능한 상태 빠진 영상이나 오디오를 확인합니다
재생 불가 오프라인 재생을 기대하기 어려운 상태 원본 접근과 다운로드 결과를 확인합니다

아카이브가 정상이어도 영상은 별도 파일로 저장되지 않았을 수 있습니다. 반대로 영상 파일이 저장되어도 페이지의 버튼이나 서버 검색 기능은 동작하지 않을 수 있습니다. 오프라인 사용의 목적을 본문 읽기, 이미지 보기, 영상 재생으로 나누어 필요한 결과를 확인합니다.

본문 탭이 비어 있으면 스크랩 전체가 실패한 것인가요?

섹션 제목: “본문 탭이 비어 있으면 스크랩 전체가 실패한 것인가요?”

본문 추출과 이미지 캡처는 다른 결과입니다. 스크린샷과 아카이브를 먼저 확인합니다. 이미지 속 글자는 텍스트 추출에 포함되지 않을 수 있습니다. 필요한 본문이 없다면 범위를 바꾸거나 OCR을 사용해 확인합니다.

작성자나 발행일이 없으면 직접 확인해야 하나요?

섹션 제목: “작성자나 발행일이 없으면 직접 확인해야 하나요?”

원본 사이트가 정보를 제공하지 않거나 읽기 어려운 방식으로 제공하면 비어 있을 수 있습니다. 날짜나 작성자가 중요하다면 원본 페이지에서 확인합니다. 저장일을 발행일로 대신 해석하지 않습니다.

content.md만 복사하면 전체 페이지를 보존할 수 있나요?

섹션 제목: “content.md만 복사하면 전체 페이지를 보존할 수 있나요?”

content.md는 추출된 본문입니다. 화면 이미지, PDF, 아카이브와 미디어 파일 전체를 대신하지 않습니다. 텍스트만 필요할 때 활용하고, 원래 화면이나 첨부까지 보관하려면 관련 파일도 함께 확인합니다.