매칭 레이팅 어프로치
Match rating approach매치 레이팅 어프로치(MRA)는 [1]동음이의어 이름의 색인화와 비교를 위해 1977년 웨스턴 항공에 의해 개발된 발음에 의한 단어의 색인화를 위한 음성 알고리즘이다.
알고리즘 자체에는 단순한 부호화 규칙 집합이 있지만 더 긴 비교 규칙 집합이 있습니다.주요 메커니즘은 유사도 비교로, 왼쪽에서 오른쪽으로, 그리고 오른쪽에서 왼쪽으로 문자열을 비교하여 동일한 문자를 제거함으로써 일치하지 않는 문자의 수를 계산합니다.이 값은 6에서 빼서 최소 임계값과 비교됩니다.최소 임계값은 표 A에 정의되어 있으며 문자열 길이에 따라 달라집니다.
부호화된 이름은 Personal Numeric Identifier(PNI; 개인 숫자 식별자)로 알려져 있습니다(잘못되었을 가능성이 있습니다).부호화된 이름은 6자를 초과할 수 없습니다.
일치 등급 접근법은 NYSIIS 알고리즘의 원래 플레이버와는 달리 문자 "y"가 포함된 이름으로 잘 작동합니다. 예를 들어, "Smith"와 "Smyth" 성이 성공적으로 일치합니다.단, MRA는 부호화된 이름의 길이가2개 이상 다른 경우에는 잘 동작하지 않습니다.
부호화 규칙
- 모음이 단어를 시작하지 않는 한 모든 모음을 삭제합니다.
- 존재하는 이중 자음의 두 번째 자음을 제거합니다.
- 처음 3글자와 마지막 3글자만 결합하여 codex를 6글자로 줄입니다.
비교 규칙
이 섹션에서 "string(s)" 및 "name(s)"이라는 단어는 "encoded string(s)" 및 "encoded name(s)"을 의미합니다.
- 부호화 문자열의 길이 차이가 3 이상일 경우 유사도 비교는 이루어지지 않습니다.
- 부호화된 문자열의 길이 합계를 계산하고 표 A를 사용하여 최소 정격값을 구합니다.
- 인코딩된 문자열을 왼쪽에서 오른쪽으로 처리하여 양쪽 문자열에서 동일한 문자를 각각 삭제합니다.
- 오른쪽에서 왼쪽으로 일치하지 않는 문자를 처리하고 두 이름에서 동일한 문자를 각각 제거합니다.
- 긴 문자열의 6개에서 일치하지 않는 문자 수를 뺍니다.이것이 유사도 평가입니다.
- 유사도 등급이 최소 등급 이상일 경우 매칭은 양호한 것으로 간주됩니다.
최소 임계값
다음 표는 최소 정격과 문자열 길이 사이의 매핑을 보여 줍니다.
| 길이의 합계 | 최소 평가 |
|---|---|
| ≤ 4 | 5 |
| 4 <합계 77 | 4 |
| 7 <합계 11 11 | 3 |
| = 12 | 2 |
등급 매칭 접근법 예시
다음 표에 일반적인 동음이의 이름에 대한 일치 등급 접근 알고리즘의 출력을 나타냅니다.
| 이름. | MRA Codex | 최소 평가 | 유사도 비교 평가 |
|---|---|---|---|
| 번 | 기준 | 4 | 5 |
| 번 | BRN | ||
| 스미스 | SMTH | 3 | 5 |
| 스미쓰 | SMYTH | ||
| 캐서린 | CTRN | 3 | 4 |
| 캐스린 | 키보드 |
「 」를 참조해 주세요.
레퍼런스
- ^ Moore, G B.; Kuhns, J L.; Treffzs, J L.; Montgomery, C A. (Feb 1, 1977). Accessing Individual Records from Personal Data Files Using Nonunique Identifiers. US National Institute of Standards and Technology. p. 17. NIST SP - 500-2.
외부 링크
| Wikibook Algorithm_implementation에는 다음 항목에 대한 페이지가 있습니다. |
- 개인 식별자 사용 관련 문제 개요, HSMD, 캐나다 통계청
- C# 실장 : http://sounditout.codeplex.com/