Cómo limpiar el texto copiado de Word o un PDF

Pega texto de Word o un PDF en un CMS, cliente de correo o editor de texto plano y a menudo obtendrás formato oculto que viene con él — etiquetas de estilo invisible, saltos de línea extraños a mitad de la oración, comillas inteligentes que no se renderizan correctamente, y caracteres específicos de fuentes que se ven bien en Word pero se rompen en otro lugar.

Qué está sucediendo realmente

Los archivos de Word y PDF almacenan texto con metadatos de formato enriquecido adjuntos a cada carácter. Cuando pegas eso en un sistema que espera texto plano o ligeramente formateado, parte de esos metadatos aparece como caracteres garrapateados o espaciado roto, especialmente entre diferentes sistemas operativos.

Cómo eliminarlo correctamente

  • Pega en BizTextFormat y usa Strip Formatting — elimina el estilo oculto mientras preserva tus saltos de párrafo reales, así no terminas con un bloque de texto gigante sin interrupciones.
  • En Google Docs, Pegar sin formato (Ctrl+Mayús+V) elimina la mayoría antes de que llegue a tu documento.
  • Para PDFs específicamente, ojo con los saltos de línea que aparecen a mitad de la oración — los PDFs a menudo almacenan texto línea por línea para la página impresa, no párrafo por párrafo.

Por qué esto importa para SEO y legibilidad

Los caracteres de formato oculto pueden hacer que plataformas CMS rendericen HTML roto, y los saltos de línea a mitad de la oración hacen que el texto se lea de manera extraña tanto para usuarios como para motores de búsqueda que analizan tu estructura de contenido. Una rápida limpieza antes de publicar evita ambos problemas.