매칭 레이팅 어프로치

Match rating approach

매치 레이팅 어프로치(MRA)는 [1]동음이의어 이름의 색인화와 비교를 위해 1977년 웨스턴 항공에 의해 개발발음에 의한 단어의 색인화위한 음성 알고리즘이다.

알고리즘 자체에는 단순한 부호화 규칙 집합이 있지만 더 긴 비교 규칙 집합이 있습니다.주요 메커니즘은 유사도 비교로, 왼쪽에서 오른쪽으로, 그리고 오른쪽에서 왼쪽으로 문자열을 비교하여 동일한 문자를 제거함으로써 일치하지 않는 문자의 수를 계산합니다.이 값은 6에서 빼서 최소 임계값과 비교됩니다.최소 임계값은 표 A에 정의되어 있으며 문자열 길이에 따라 달라집니다.

부호화된 이름은 Personal Numeric Identifier(PNI; 개인 숫자 식별자)로 알려져 있습니다(잘못되었을 가능성이 있습니다).부호화된 이름은 6자를 초과할 수 없습니다.

일치 등급 접근법은 NYSIIS 알고리즘의 원래 플레이버와는 달리 문자 "y"가 포함된 이름으로 잘 작동합니다. 예를 들어, "Smith"와 "Smyth" 성이 성공적으로 일치합니다.단, MRA는 부호화된 이름의 길이가2개 이상 다른 경우에는 잘 동작하지 않습니다.

부호화 규칙

  1. 모음이 단어를 시작하지 않는 한 모든 모음을 삭제합니다.
  2. 존재하는 이중 자음의 두 번째 자음을 제거합니다.
  3. 처음 3글자와 마지막 3글자만 결합하여 codex를 6글자로 줄입니다.

비교 규칙

이 섹션에서 "string(s)" 및 "name(s)"이라는 단어는 "encoded string(s)" 및 "encoded name(s)"을 의미합니다.

  1. 부호화 문자열의 길이 차이가 3 이상일 경우 유사도 비교는 이루어지지 않습니다.
  2. 부호화된 문자열의 길이 합계를 계산하고 표 A를 사용하여 최소 정격값을 구합니다.
  3. 인코딩된 문자열을 왼쪽에서 오른쪽으로 처리하여 양쪽 문자열에서 동일한 문자를 각각 삭제합니다.
  4. 오른쪽에서 왼쪽으로 일치하지 않는 문자를 처리하고 두 이름에서 동일한 문자를 각각 제거합니다.
  5. 긴 문자열의 6개에서 일치하지 않는 문자 수를 뺍니다.이것이 유사도 평가입니다.
  6. 유사도 등급이 최소 등급 이상일 경우 매칭은 양호한 것으로 간주됩니다.

최소 임계값

다음 표는 최소 정격과 문자열 길이 사이의 매핑을 보여 줍니다.

표 A
길이의 합계 최소 평가
≤ 4 5
4 <합계 77 4
7 <합계 11 11 3
= 12 2

등급 매칭 접근법 예시

다음 표에 일반적인 동음이의 이름에 대한 일치 등급 접근 알고리즘의 출력을 나타냅니다.

이름. MRA Codex 최소 평가 유사도 비교 평가
기준 4 5
BRN
스미스 SMTH 3 5
스미쓰 SMYTH
캐서린 CTRN 3 4
캐스린 키보드

「 」를 참조해 주세요.

사운드텍스

레퍼런스

  1. ^ Moore, G B.; Kuhns, J L.; Treffzs, J L.; Montgomery, C A. (Feb 1, 1977). Accessing Individual Records from Personal Data Files Using Nonunique Identifiers. US National Institute of Standards and Technology. p. 17. NIST SP - 500-2.

외부 링크