tac*_*cos 1 java codepoint character-encoding java-8
给定String stringJava中的一个,确实string.codePoints().toArray().length反映String了人类会发现有意义的实际字符的长度吗?换句话说,它是否平滑了转义字符和其他编码工件?
编辑 "人类"我的意思是"程序员",因为我想大多数程序员会看到\r\n两个角色,ESC一个角色等等.但是现在我看到即使是重音标记也会被雾化,所以无关紧要.
没有.
例如:
控制字符(如ESC,CR,NL等)不会被删除.这些在Unicode中具有不同的代码点.
空格,制表符等的序列不组合
不删除自由连字符(http://www.fileformat.info/info/unicode/char/00AD/index.htm)字符.
Unicode组合字符(https://en.wikipedia.org/wiki/Combining_character)未合并.
现在有争议的是,其中一些可能是"人类会发现有意义的实际角色" ......但总体答案仍然是否定的.
你澄清如下:
通过"人类"我的意思是"程序员",我想大多数程序员都会看到\ r \n作为两个字符......
它比这更复杂.我是程序员,对我而言,它取决于上下文是否\r\n有意义.如果我正在阅读README文件,我的大脑会将空白区域的差异视为没有语义重要性.但是如果我正在编写一个解析器,我的代码会考虑空格...取决于它要解析的语言.
| 归档时间: |
|
| 查看次数: |
997 次 |
| 最近记录: |