성경문자
Bibliogram서지그램은 사용자가 제공한 한 가지 이상의 시드 용어와 함께 발생 빈도에 따라 텍스트가 확장된 명사 구문이 높은 순위에서 낮은 순위로 분류될 때 만들어진 언어 구조다.각 서지그램에는 다음 세 가지 구성 요소가 있다.
- 컨텍스트를 설정하는 시드 용어.
- 일부 레코드 집합에 걸쳐 씨앗과 함께 발생하는 단어.
- 동시 발생 단어를 높음에서 낮음으로 정렬할 수 있는 카운트(빈도)
이 용어는 하워드 D에 의해 2005년에 도입되었다. 흰색으로, 정보 통계학, 사이언톨로메트릭스 및 서지학에서 연구되었지만 이전에 이름이 붙여지지 않은 언어적 대상의 이름이다.순위에 있는 명사구는 저자, 저널, 제목 또는 기타 색인 용어일 수 있다."문헌의 기록"은 책, 관련 기사 세트, 주제 참고 문헌 목록, 웹 페이지 세트 등이 될 수 있다.성경문자는 항상 글에서 생성되는데, 보통은 학자적 또는 과학적인 문학에서 나온다.
용어 빈도 분포의 한 계열로서, 다음과 같은 설명에 따라 성경 구절은 자주 작성되었다.
그것은 때때로 "핵심과 산포" 분포라고 불린다."핵심"은 전체적 공동 발생에서 불균형적으로 큰 비중을 차지하는 상위 약관으로 구성된다.
"스캐터(scatter)"는 공동발생의 나머지 몫을 차지하는 비교적 하위권 약관으로 구성된다.보통 상위권 항은 주파수로 묶이지 않지만, 주파수가 작아질수록 동일한 주파수와 동점 순위는 더 흔해진다.분포의 맨 아래에는 각 항이 한 번만 일치하기 때문에 긴 항 꼬리가 순위에 묶여 있다.
대부분의 경우, 비블리오그램은 Zipf의 법칙과 Bradford의 법칙과 같은 권력 법칙으로 묘사될 수 있다.이런 점에서 그들은 오랫동안 정보과학 분야에서 수학자와 통계학자에 의해 연구되어 왔다.그러나 이러한 치료법은 일반적으로 순위에 오른 용어 자체의 질적 의미를 무시하는데, 이는 종종 그들 자신의 권리에 관심이 있는 것이다.예를 들어, 다음의 성경문자는 작가의 이름을 시드로 하여 만들어졌고 ERIC 데이터베이스에서 그녀의 이름과 함께 발생하는 서술자들을 보여준다.이 설명자들은 색인 작성에 사용된 그녀의 글의 수에 따라 순위가 매겨진다.
6 창의력 4 창의력 테스트 3 초등학교 수학 2 교육 2 교육 2 문제 해결 2 연구 2 시간 1 가속도 1 불안 1 기초 교사 1 행동 목표 1 아동 발달 1 교실 기술 1 인지 발달 등
이 저자는 교육학 연구원이며, 이 용어들이 수년 동안 그녀의 지적 관심사를 프로파일링하는 것으로 보일 것이다.일반적으로, 비블리오그램은 다음을 위해 사용될 수 있다.
- 검색 전략에 대한 추가 용어를 제안하다.
- 학자, 과학자, 기관의 일을 특징짓다.
- 작가가 누구를 인용하는지를 시간이 지남에 따라 보여 주다.
- 시간이 흐르면서 누가 작가를 인용하는지 보여주다.
- 작가가 누구와 시간을 두고 공동 집필을 하는지를 다른 작가들에게 보여주다.
- 저널이나 작가와 관련된 주제를 보여주다.
- 주제와 관련된 저자, 단체 또는 학술지를 보여주다.
- 제목과 관련된 라이브러리 분류 코드 표시 및 그 반대의 경우
- 도서관의 소장품에서 물건의 인기를 나타내다.
- 제목 용어, 설명자, 작성자 이름, 저널 이름을 사용하여 문학 구조를 모델링
비블리오그램은 Dialog에서 LOCK 명령어(다른 벤더도 비슷한 명령을 가지고 있음), 월드캣, 히스캐이트, 구글 스콜라, 저렴한 콘텐츠 분석 소프트웨어 내에서 순위 옵션을 사용하여 만들 수 있다.
화이트는 그가 연관문이라고 부르는 것에 있어서 성경문자는 평행한 구조를 가지고 있다고 제안한다.이것들은 심리 언어학에서 연구된 단어 연관 규범들의 순위 목록이다.그것들은 통계 구조에서 비블리오그램과 유사하지만 글에서 만들어지지는 않는다.오히려 자극용어(씨앗용어처럼 기능하는)를 가진 사람들의 패널을 제시하고, 씨앗과 연관되는 단어들을 공동 발생 빈도에 따라 표로 작성함으로써 생성된다.그들은 현재 문서 검색을 위한 사우리를 만드는 비표준적인 방법으로 정보 과학자들에게 관심이 있다.
예
그 밖의 참고문헌의 예로는 저자의 공동저자나 특정 저널에 게재되는 저자의 목록과 그 논문 수가 순서에 따라 배열된 것이 있다.아마존에서 아이템을 검색할 때 받을 수 있는 추가 타이틀 리스트가 대표적인 예다.이러한 추천 제목들은 검색어를 시드로 사용하여 구성된 서지그램의 "핵심"에 있는 상위 용어들이다.빈도는 씨앗과 함께 구매된 시간의 수입니다.
연관문구의 예는 에딘버러 협회 테사우루스(Assarus)에서 찾을 수 있다.
기타 방법
데이터 클러스터링과 데이터 마이닝에는 유사하지만 다른 방법이 사용된다.구글 세트는 또한 주어진 조건들의 집합에 관련된 용어들의 목록을 만든다.
참고 항목
참조
- 하워드 D.흰색(2005):정보 통계 확장: 의견서.인: 제10차 국제 사이언톨로지 및 정보학회의 국제회의의 의사록.스톡홀름 페이지 442-449