vba判断⽂件编码格式_如何⽤vba判断⼀个记事本⽂本⽂件是
什么编码?
在了解如何⽤vba判断⼀个⽂本⽂件是以什么编码形式保存之前,我们先来了解下字节序的概念。
⽐如⼀个中⽂字符“保”的unicode编码为4FDD,在存⼊到计算机时,需要⽤2个字节,如果第⼀个字节存4F,第⼆个字节存DD,那么它的字节序就是Big Endian。如果第⼀个字节存DD,第⼆个字节存4F,那么它的字节序就是 Little Endian。
由于⼀个⽂本⽂件可以保存为ANSI编码、Unicode Little Endian 编码、Unicode Big Endian 编码、UTF-8编码,为了便于识别具体是⽤哪种编码哪种字节序存储的⽂本⽂件,Windows 引⼊了BOM(Byte Order Mark,字节序标记)来表征⽂本⽂件的编码⽅式。
在unicode编码中有⼀个叫做”ZERO WIDTH NO-BREAK SPACE”的字符,它的编码是FEFF。⽽FFFE在unicode编码中是不存在的字符,所以不应该出现在实际传输中。UCS规范建议我们在传输字节流前,先传输字符”ZERO WIDTH NO-BREAK SPACE”。这样如果接收者收到FEFF,就表明这个字节流是Big-Endian的;如果收到FFFE,就表明这个字节流是Little-Endian的。因此字符”ZERO WIDTH NO-BREAK SPACE”⼜被称作BOM。
UTF-8不需要BOM来表明字节顺序,但可以⽤BOM来表明编码⽅式。字符”ZERO WIDTH NO-BREAK SPACE”的UTF-8编码是EF BB BF。所以如果接收者收到以EF BB BF开头的字节流,就知道这是UTF-8编码了。
Windows就是使⽤BOM来标记⽂本⽂件的编码⽅式的。
当⽤编程的⽅式判断⼀个⽂本⽂件的编码⽅式时,如果以⼆进制形式读取⽂件头的前两个字节,如果是FEFF,则表⽰Unicode Big Endian 编码。如果是FFFE,则表⽰Unicode Little Endian 编码。如果前三个字节是EFBBBF则表⽰UTF-8编码。如果都不是,则表⽰是ANSI编码。
有了以上的知识,可以使⽤以下的代码判断⼀个⽂本⽂件的编码⽅式:
Visual Basic
Sub QQ1722187970()
Dim sPath As String
sPath = "c:\"
iFN = VBA.FreeFile
Open sPath For Binary Access Read As iFN
Dim iLenB
'获取打开⽂本⽂件的字节数
iLenB = VBA.LOF(iFN)
If iLenB > 0 Then
Dim sResult() As Byte
ReDim sResult(iLenB - 1)
unicode文件格式Get iFN, , sResult
Select Case UBound(sResult)
Case 0
MsgBox "ANSI编码"
Case 1
sBom = VBA.Hex(sResult(0)) & VBA.Hex(sResult(1))
If sBom = "FEFF" Then
MsgBox "Unicode Big Endian 编码"
ElseIf sBom = "FFFE" Then
MsgBox "Unicode Little Endian 编码"
Else
MsgBox "ANSI编码"
End If
Case Is > 1
sBom = VBA.Hex(sResult(0)) & VBA.Hex(sResult(1)) & VBA.Hex(sResult(2)) If Left(sBom, 4) = "FEFF" Then
MsgBox "Unicode Big Endian 编码"
ElseIf Left(sBom, 4) = "FFFE" Then
MsgBox "Unicode Little Endian 编码"
ElseIf Left(sBom, 6) = "EFBBBF" Then
MsgBox "UTF-8编码"
Else
MsgBox "ANSI编码"
End If
End Select
End If
'关闭打开的⽂件
Close iFN
End Sub
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
SubQQ1722187970() DimsPathAsString
sPath="c:\"
iFN=VBA.FreeFile OpensPathForBinaryAccessReadAsiFN
'获取打开⽂本⽂件的字节数
iLenB=VBA.LOF(iFN)
IfiLenB>0Then
DimsResult()AsByte
ReDimsResult(iLenB-1)
GetiFN,,sResult
SelectCaseUBound(sResult)
Case0
MsgBox"ANSI编码"
Case1
sBom=VBA.Hex(sResult(0))&VBA.Hex(sResult(1))
IfsBom="FEFF"Then
MsgBox"Unicode Big Endian 编码"
ElseIfsBom="FFFE"Then
MsgBox"Unicode Little Endian 编码"
Else
MsgBox"ANSI编码"
EndIf
CaseIs>1
sBom=VBA.Hex(sResult(0))&VBA.Hex(sResult(1))&VBA.Hex(sResult(2)) IfLeft(sBom,4)="FEFF"Then
MsgBox"Unicode Big Endian 编码"
ElseIfLeft(sBom,4)="FFFE"Then
MsgBox"Unicode Little Endian 编码"
ElseIfLeft(sBom,6)="EFBBBF"Then
MsgBox"UTF-8编码"
Else
MsgBox"ANSI编码"
EndIf
EndSelect
EndIf
'关闭打开的⽂件
CloseiFN
版权声明:本站内容均来自互联网,仅供演示用,请勿用于商业和其他非法用途。如果侵犯了您的权益请与我们联系QQ:729038198,我们将在24小时内删除。
发表评论