import os
import re

# Obtiene el directorio actual de ejecución del script
directorio_raiz = os.getcwd()

# Compila las expresiones regulares fuera del bucle para eficiencia
patron_contenido = re.compile(r'</main>\s*</div>.*?</body>', re.DOTALL)
# Actualizado para eliminar solo atributos type de los tags de script
# Esta expresión regular busca tags de script, captura todo hasta "type=" y luego elimina "type" y su valor
patron_type = re.compile(r'(<script[^>]*?)\s*type="[^"]*"(.*?>)', re.IGNORECASE)

# Función para procesar cada archivo HTML
def procesar_archivo(path):
    with open(path, 'r', encoding='utf-8') as file:
        content = file.read()

    # Reemplaza el contenido basado en los patrones
    content = re.sub(patron_contenido, '</main></div>\n</body>', content)
    # Actualizado para eliminar específicamente el atributo type de los tags de script
    content = re.sub(patron_type, r'\1\2', content)

    with open(path, 'w', encoding='utf-8') as file:
        file.write(content)

# Recorre el directorio raíz y sus subdirectorios
for directorio, subdirs, archivos in os.walk(directorio_raiz):
    for archivo in archivos:
        if archivo.endswith('.html'):
            path_completo = os.path.join(directorio, archivo)
            print(f'Procesando: {path_completo}')
            procesar_archivo(path_completo)

print('Proceso completado.')

