📌 ¿Cómo puedes extraer publicaciones, comentarios y respuestas de Reddit a partir de las URL de las publicaciones?
Esta plantilla recopila datos de publicaciones y discusiones a partir de las URL de publicaciones de Old Reddit enviadas, incluyendo subreddit, título y cuerpo de la publicación, autor, votos positivos, imágenes y enlaces del cuerpo, recuento de comentarios, texto y metadatos de los comentarios, respuestas, y URL e ID de los comentarios. Es útil para equipos de escucha social, investigadores académicos y analistas de comunidades.
Los datos se recopilan de Old Reddit. Reddit es una plataforma de discusión comunitaria organizada en subreddits, publicaciones, comentarios e hilos de respuestas.
💰 Precios
Precio actual: $0.1/1,000 líneas. La facturación se basa en el número de líneas de salida producidas por la tarea.
📦 Salida
La implementación publicada actualmente puede devolver los siguientes campos:
Input_URLSubRedditPost_TitlePost_BodyPost_UpvotePost_AuthorPost_ImagePost_Body_URLsComment_CountComment_bodyCommentorCommentor_pointsComment_TimeComment_URLComment_IDReplies_bodyReplierReplier_pointsReplied_TimeLoad_More_Comment_Countmsg_typecontentlink_idsortchildrenidlimit_childrenrrenderstyleHTML_SourceStatus
{
"Input_URL": null,
"SubReddit": null,
"Post_Title": null,
"Post_Body": null,
"Post_Upvote": null,
"Post_Author": null,
"Post_Image": null,
"Post_Body_URLs": null,
"Comment_Count": null,
"Comment_body": null,
"Commentor": null,
"Commentor_points": null,
"Comment_Time": null,
"Comment_URL": null,
"Comment_ID": null,
"Replies_body": null,
"Replier": null,
"Replier_points": null,
"Replied_Time": null,
"Load_More_Comment_Count": null,
"msg_type": null,
"content": null,
"link_id": null,
"sort": null,
"children": null,
"id": null,
"limit_children": null,
"r": null,
"renderstyle": null,
"HTML_Source": null,
"Status": null
}
🎯 Casos de Uso
- Analizar temas de discusión utilizando los cuerpos de las publicaciones, comentarios y respuestas.
- Medir la interacción utilizando los votos positivos de las publicaciones, el recuento de comentarios y los puntos de los comentaristas.
- Estudiar la estructura de la conversación utilizando los ID de los comentarios, las URL y los campos de respuesta.
- Construir conjuntos de datos de discusión de series temporales utilizando las marcas de tiempo de los comentarios y las respuestas.
🐙 Por qué Octoparse
- Flujo de trabajo listo para usar: Los pasos de extracción para Old Reddit ya están configurados, por lo que no necesitas construir el scraper desde cero.
- Ejecución flexible: Ejecuta la tarea predefinida en la nube sin necesidad de mantener un ordenador local en línea para la recopilación.
- Salida estructurada y repetible: Los resultados se devuelven como filas consistentes que son más fáciles de comparar, filtrar, deduplicar y procesar que las páginas copiadas manualmente.
- Barandillas de entrada verificadas: El formulario expone las entradas actuales, los valores seleccionables y los límites significativos configurados para esta plantilla.
- Transferencia de datos práctica: Revisa los resultados en Octoparse y expórtalos o procésalos utilizando las opciones compatibles con tu entorno de Octoparse.
📝 Entrada
Completa los siguientes campos:
- URL de publicaciones de Old Reddit (Requerido) — URL de publicaciones de Old Reddit. Hasta 100,000 entradas por ejecución.
🚀 Cómo Usar
- Abre la plantilla y selecciona Probar o Iniciar.
- Completa los campos de entrada mencionados anteriormente.
- Inicia la tarea utilizando el modo de ejecución en la nube compatible.
- Revisa las filas de salida y exporta o procesa los datos estructurados.
⚠️ Limitaciones
Los resultados dependen de lo que el sitio de origen exponga en tiempo de ejecución. Un campo de salida listado puede estar vacío cuando la página de origen no proporciona ese valor. Los límites de entrada mostrados arriba son aplicados por la plantilla.
💡 Consejos
Usa entradas específicas y válidas y revisa un resultado representativo antes de iniciar un lote grande. Elimina las entradas duplicadas cuando no se necesiten registros repetidos.
❓ Preguntas Frecuentes
¿Cómo recopila Octoparse datos de Old Reddit?
La automatización de Python abre cada URL de publicación de Old Reddit, analiza la publicación, carga el árbol de comentarios, solicita ramas de comentarios adicionales cuando están presentes y sube registros estructurados de publicaciones, comentarios y respuestas.
¿Qué entrada requiere este Scraper de Publicaciones y Comentarios de Reddit?
Usa los campos y valores aceptados que se muestran en la sección de Entrada. Solo se enumeran los límites relevantes para el usuario y las opciones seleccionables.
¿Qué datos puedo extraer de Old Reddit?
Los campos de salida actuales y una Prevista de datos JSON representativa se enumeran en la sección de Salida. La disponibilidad de los campos puede variar cuando la página de origen no muestra un valor.
¿Cuánto cuesta este Scraper de Publicaciones y Comentarios de Reddit?
El precio actual es de $0.1/1,000 líneas, y la facturación se basa en el número de líneas de salida producidas por la tarea.
¿Por qué algunos campos de Old Reddit pueden estar vacíos?
Las páginas de origen no siempre exponen todos los valores para cada registro, y los diseños pueden variar según el artículo, el mercado o la respuesta actual del sitio. La plantilla devuelve un campo cuando la página actual lo proporciona.
¿Puedo exportar los datos recopilados de Old Reddit?
Puedes revisar las filas estructuradas en Octoparse y exportarlas o procesarlas utilizando las opciones compatibles con tu entorno de Octoparse.
🔗 Plantillas Relacionadas
- Reddit Search Scraper — Usa Reddit Search Scraper para un flujo de trabajo complementario en el mismo sitio de origen.
- Reddit Trending Scraper — Usa Reddit Trending Scraper para un flujo de trabajo complementario en el mismo sitio de origen.
- Reddit Post Scraper (by Keywords) — Usa Reddit Post Scraper (by Keywords) para un flujo de trabajo complementario en el mismo sitio de origen.