Red semántica dirigida construida a partir de los bigramas con frecuencia ≥ 3 en las intervenciones sustantivas de la sesión. El tamaño de los nodos refleja su PageRank en la red; el grosor de las aristas indica la frecuencia de co-ocurrencia secuencial. Los nodos centrales revelan el campo semántico dominante.
Nodos por PageRank
Bigramas y trigramas extraídos del corpus de intervenciones sustantivas. Los bigramas representan pares de conceptos recurrentes; los trigramas, tríadas con mayor exigencia de co-ocurrencia y, por tanto, mayor significación semántica. Haz clic sobre cualquier fila para abrir la red semántica resaltando la palabra.
Bigramas (f ≥ 4)
Trigramas (f ≥ 3)
Sentimiento por intervención. Score en [−1, +1]. Se aplican dos métodos en paralelo: un diccionario léxico simple (cuenta palabras positivas y negativas; interpretable pero ciego a la negación y al contexto) y un transformer multilingüe (pysentimiento/robertuito-sentiment-analysis, RoBERTa preentrenada en español). El selector cambia la métrica activa en el gráfico, la lista por orador y la barra global.
Distribución global
Sobre intervenciones sustantivas (≥35 palabras) de la sesión.
Por orador
Mayores divergencias léxico vs. transformer
Oradores donde ambos métodos discrepan más en esta sesión. Suele ocurrir cuando el discurso usa fórmulas positivas (respaldo, valoro, agradezco) pero el contenido es crítico — el transformer captura el contexto que el diccionario no ve.
| Orador | Léxico | Transformer | Δ |
|---|
Palabras distintivas por orador calculadas mediante TF-IDF. Identifica los conceptos que caracterizan a cada parlamentario respecto del resto del corpus de la sesión. La primera palabra es la de mayor peso TF-IDF. Solo las palabras que también aparecen en la red semántica son clicables (se resaltan al pasar el cursor); haz clic para abrirlas en la red.
Cada intervención sustantiva del periodo 2026-2030 se vectoriza con un transformer multilingüe (paraphrase-multilingual-MiniLM-L12-v2, 384 dimensiones) y se proyecta con UMAP (métrica coseno, n_neighbors=15, min_dist=0.1). Los puntos cercanos comparten campo semántico; los lejanos hablan de cosas distintas. 151 intervenciones de las sesiones procesadas hasta la fecha.
En 2D, arrastra para mover y rueda para zoom. En 3D, arrastra para rotar; rueda para zoom; doble clic para reiniciar la vista. Haz clic en un partido de la leyenda para ocultarlo o mostrarlo; doble clic en uno para aislarlo (y doble clic de nuevo para volver a mostrar todos).
Frecuencias absolutas de términos en el corpus de intervenciones sustantivas. Se excluyen stopwords del español y vocabulario procedural parlamentario. Las palabras presentes en la red semántica son clicables.
Metodología
Procesamiento de texto
Tokenización en español con filtrado de stopwords. Frecuencias unigramas, bigramas y trigramas se calculan con nltk. La red semántica se construye con networkx a partir de las co-ocurrencias secuenciales; el peso de cada nodo es su PageRank en la red dirigida.
Sentimiento y embeddings
Sentimiento por diccionario léxico (interpretable; gold standard en ciencia política) y por transformer (RoBERTuito vía pysentimiento). Embeddings con sentence-transformers y proyección 3D con UMAP métrica coseno.
Fuente
Diario de Sesiones de la Cámara de Diputadas y Diputados (camara.cl). Procesamiento: Centro de Estudios Públicos, C22.