使用 FParsec,如何在解析器之间使用 manyCharsTill 而不会在结束字符串上失败?

Ben*_*ins 2 f# parsing fparsec

我正在尝试使用 FParsec 来解析 TOML 多行字符串,但在使用结束分隔符 ( """) 时遇到了问题。我有以下解析器:

let controlChars = 
    ['\u0000'; '\u0001'; '\u0002'; '\u0003'; '\u0004'; '\u0005'; '\u0006'; '\u0007';
     '\u0008'; '\u0009'; '\u000a'; '\u000b'; '\u000c'; '\u000d'; '\u000e'; '\u000f';
     '\u0010'; '\u0011'; '\u0012'; '\u0013'; '\u0014'; '\u0015'; '\u0016'; '\u0017';
     '\u0018'; '\u0019'; '\u001a'; '\u001b'; '\u001c'; '\u001d'; '\u001e'; '\u001f';
     '\u007f']

let nonSpaceCtrlChars =
    Set.difference (Set.ofList controlChars) (Set.ofList ['\n';'\r';'\t'])

let multiLineStringContents : Parser<char,unit> =
    satisfy (isNoneOf nonSpaceCtrlChars)

let multiLineString         : Parser<string,unit> =
    optional newline >>. manyCharsTill multiLineStringContents (pstring "\"\"\"")
    |> between (pstring "\"\"\"") (pstring "\"\"\"") 

let test parser str =
    match run parser str with
    | Success (s1, s2, s3) -> printfn "Ok: %A %A %A" s1 s2 s3
    | Failure (f1, f2, f3) -> printfn "Fail: %A %A %A" f1 f2 f3
Run Code Online (Sandbox Code Playgroud)

当我multiLineString针对这样的输入进行测试时:

test multiLineString "\"\"\"x\"\"\""
Run Code Online (Sandbox Code Playgroud)

解析器失败并出现以下错误:

失败:"Error in Ln: 1 Col: 8 """x""" ^ 注意:错误发生在输入流的末尾。期望:'"""'

我对此感到困惑。manyCharsTill multiLineStringContents (pstring "\"\"\"")解析器不会停下"""来让between解析器找到它吗?为什么解析器吃掉所有的输入然后让between解析器失败?

这似乎是一个相关的帖子:如何使用 FParsec 解析评论

但我看不出那个解决方案与我在这里所做的有什么不同,真的。

rmu*_*unn 5

manyCharsTill文件说,(重点煤矿):

manyCharsTill cp endp使用字符解析器解析字符,cp直到解析器endp成功。它在之后endp停止并将解析的字符作为字符串返回。

所以你不想betweenmanyCharsTill;结合使用 你想做类似的事情pstring "\"\"\"" >>. manyCharsTill (pstring "\"\"\"")

但碰巧的是,我可以为您节省很多工作。我在业余时间一直在使用 FParsec 开发 TOML 解析器。它远未完成,但字符串部分可以正常工作并正确处理反斜杠转义(据我所知:我已经进行了彻底但未详尽的测试)。我唯一缺少的是“如果它出现在开始分隔符之后,则去掉第一个换行符”规则,您已经使用optional newline. 因此,只需将这一点添加到我下面的代码中,您就应该有一个可用的 TOML 字符串解析器。

顺便说一句,我计划在 MIT 许可下许可我的代码(如果我完成了它)。所以我特此在 MIT 许可下发布以下代码块。如果它对您有用,请随意在您的项目中使用它。

let pShortCodepointInHex = // Anything from 0000 to FFFF, *except* the range D800-DFFF
    (anyOf "dD" >>. (anyOf "01234567" <?> "a Unicode scalar value (range D800-DFFF not allowed)") .>>. exactly 2 isHex |>> fun (c,s) -> sprintf "d%c%s" c s)
    <|> (exactly 4 isHex <?> "a Unicode scalar value")

let pLongCodepointInHex = // Anything from 00000000 to 0010FFFF, *except* the range D800-DFFF
        (pstring "0000" >>. pShortCodepointInHex)
        <|> (pstring "000"  >>. exactly 5 isHex)
        <|> (pstring "0010" >>. exactly 4 isHex |>> fun s -> "0010" + s)
        <?> "a Unicode scalar value (i.e., in range 00000000 to 0010FFFF)"

let toCharOrSurrogatePair p =
    p |> withSkippedString (fun codePoint _ -> System.Int32.Parse(codePoint, System.Globalization.NumberStyles.HexNumber) |> System.Char.ConvertFromUtf32)

let pStandardBackslashEscape =
    anyOf "\\\"bfnrt"
    |>> function
        | 'b' -> "\b"      // U+0008 BACKSPACE
        | 'f' -> "\u000c"  // U+000C FORM FEED
        | 'n' -> "\n"      // U+000A LINE FEED
        | 'r' -> "\r"      // U+000D CARRIAGE RETURN
        | 't' -> "\t"      // U+0009 CHARACTER TABULATION a.k.a. Tab or Horizonal Tab
        | c   -> string c

let pUnicodeEscape =     (pchar 'u' >>. (pShortCodepointInHex |> toCharOrSurrogatePair))
                     <|> (pchar 'U' >>. ( pLongCodepointInHex |> toCharOrSurrogatePair))

let pEscapedChar = pstring "\\" >>. (pStandardBackslashEscape <|> pUnicodeEscape)

let quote = pchar '"'
let isBasicStrChar c = c <> '\\' && c <> '"' && c > '\u001f' && c <> '\u007f'
let pBasicStrChars = manySatisfy isBasicStrChar
let pBasicStr = stringsSepBy pBasicStrChars pEscapedChar |> between quote quote

let pEscapedNewline = skipChar '\\' .>> skipNewline .>> spaces
let isMultilineStrChar c = c = '\n' || isBasicStrChar c
let pMultilineStrChars = manySatisfy isMultilineStrChar


let pTripleQuote = pstring "\"\"\""

let pMultilineStr = stringsSepBy pMultilineStrChars (pEscapedChar <|> (notFollowedByString "\"\"\"" >>. pstring "\"")) |> between pTripleQuote pTripleQuote
Run Code Online (Sandbox Code Playgroud)