разбор списка в скобках в imaplib python

Я ищу простой способ разделить списки в скобках, которые выходят из ответов IMAP, на списки или кортежи Python. я хочу уйти от

'(BODYSTRUCTURE ("text" "plain" ("charset" "ISO-8859-1") NIL NIL "quoted-printable" 1207 50 NIL NIL NIL NIL))'

to

(BODYSTRUCTURE, ("text", "plain", ("charset", "ISO-8859-1"), None, None, "quoted-printable", 1207, 50, None, None, None, None))

person iter    schedule 20.10.2010    source источник


Ответы (3)


Функция анализатора pyparsing nestedExpr по умолчанию анализирует вложенные круглые скобки:

from pyparsing import nestedExpr

text = '(BODYSTRUCTURE ("text" "plain" ("charset" "ISO-8859-1") NIL NIL "quotedprintable" 1207 50 NIL NIL NIL NIL))'

print nestedExpr().parseString(text)

печатает:

[['BODYSTRUCTURE', ['"text"', '"plain"', ['"charset"', '"ISO-8859-1"'], 'NIL', 'NIL', '"quoted printable"', '1207', '50', 'NIL', 'NIL', 'NIL', 'NIL']]]

Вот слегка модифицированный синтаксический анализатор, который во время синтаксического анализа преобразует целочисленные строки в целые числа, из «NIL» в None и удаляет кавычки из строк в кавычках:

from pyparsing import (nestedExpr, Literal, Word, alphanums, 
    quotedString, replaceWith, nums, removeQuotes)

NIL = Literal("NIL").setParseAction(replaceWith(None))
integer = Word(nums).setParseAction(lambda t:int(t[0]))
quotedString.setParseAction(removeQuotes)
content = (NIL | integer | Word(alphanums))

print nestedExpr(content=content, ignoreExpr=quotedString).parseString(text)

Отпечатки:

[['BODYSTRUCTURE', ['text', 'plain', ['charset', 'ISO-8859-1'], None, None, 'quoted-printable', 1207, 50, None, None, None, None]]]
person PaulMcG    schedule 20.10.2010

Убираем только внутреннюю часть ответа сервера, содержащую собственно структуру тела:

struct = ('(((("TEXT" "PLAIN" ("CHARSET" "ISO-8859-1") NIL NIL "7BIT" 16 2)'
         '("TEXT" "HTML" ("CHARSET" "ISO-8859-1") NIL NIL "QUOTED-PRINTABLE"'
         ' 392 6) "ALTERNATIVE")("IMAGE" "GIF" ("NAME" "538.gif") '
         '"<[email protected]>" NIL "BASE64" 172)("IMAGE" "PNG" ("NAME" '
         '"4F4.png") "<[email protected]>" NIL "BASE64" 754) "RELATED")'
         '("IMAGE" "JPEG" ("NAME" "avatar_airbender.jpg") NIL NIL "BASE64"'
         ' 157924) "MIXED")')

Следующим шагом является замена некоторых токенов, что подготовит строку для преобразования в типы python:

struct = struct.replace(' ', ',').replace(')(', '),(')

Используя встроенный модуль compiler для разбора нашей структуры:

import compiler
expr = compiler.parse(struct.replace(' ', ',').replace(')(', '),('), 'eval')

Выполнение простой рекурсивной функции для преобразования выражения:

def transform(expression):
    if isinstance(expression, compiler.transformer.Expression):
        return transform(expression.node)
    elif isinstance(expression, compiler.transformer.Tuple):
        return tuple(transform(item) for item in expression.nodes)
    elif isinstance(expression, compiler.transformer.Const):
        return expression.value
    elif isinstance(expression, compiler.transformer.Name):
        return None if expression.name == 'NIL' else expression.name

И, наконец, мы получаем желаемый результат в виде вложенных кортежей Python:

result = transform(expr)
print result

(((('TEXT', 'PLAIN', ('CHARSET', 'ISO-8859-1'), None, None, '7BIT', 16, 2), ('TEXT', 'HTML', ('CHARSET', 'ISO-8859-1'), None, None, 'QUOTED-PRINTABLE', 392, 6), 'ALTERNATIVE'), ('IMAGE', 'GIF', ('NAME', '538.gif'), '<[email protected]>', None, 'BASE64', 172), ('IMAGE', 'PNG', ('NAME', '4F4.png'), '<[email protected]>', None, 'BASE64', 754), 'RELATED'), ('IMAGE', 'JPEG', ('NAME', 'avatar_airbender.jpg'), None, None, 'BASE64', 157924), 'MIXED')

Откуда мы можем распознать разные заголовки структуры тела:

text, attachments = (result[0], result[1:])
person scraplesh    schedule 29.09.2011

Тот факт, что есть вложенные кортежи, делает это невозможным с регулярным выражением. Вам придется написать синтаксический анализатор, чтобы определить, находитесь ли вы в скобках или нет.

Вы могли бы попробовать

tuple('(BODYSTRUCTURE ("text" "plain" ("charset" "ISO-8859-1") NIL NIL "quoted-printable" 1207 50 NIL NIL NIL NIL))'.replace("NIL", "None").split(' '))

Редактировать: Ну, у меня есть кое-что, что работает с вашим примером, но не уверен, что это то, что вы хотите.

СТРУКТУРА ТЕЛА должна быть где-то определена.

eval(",".join([a for a in '(BODYSTRUCTURE ("text" "plain" ("charset" "ISO-8859-1") NIL NIL "quoted-printable" 1207 50 NIL NIL NIL NIL))'.replace("NIL", "None").split(' ')]))

person Falmarri    schedule 20.10.2010