Variables and operationalization
| Variable (dataset field) | Measurement |
|---|---|
| Service failure clusters (theme_clusters) | Lexicon match to seven clusters: Delay & Disruption; Crowding & Capacity; Ticketing & Refunds; Comfort & Cleanliness; Staff & Communication; Safety & Security; Accessibility (multi-label) |
| Matched terms (…_kw_matched) | Exact lexicon terms matched per cluster (audit trail for transparency) |
| Rail system context (rail_context) | USA, UK, Continental Europe, Asia-Pacific; high-speed, commuter/urban, sleeper/night, intercity (multi-label) |
| Operator mentions (operators_mentioned) | Named operators (e.g. Amtrak, ÖBB, SNCF, Eurostar, LNER) via alias dictionaries |
| Service dimensions (service_dimensions) | Nine target dimensions for dimension-level sentiment: reliability/punctuality; crowding; ticketing/fares; comfort/cleanliness; food & catering; staff & communication; safety & security; accessibility; information systems |
| Sentiment valence | VADER compound score in [−1, 1]; negative-token proportion; categorical label (positive ≥0.05, negative ≤ −0.05, neutral otherwise) |
| Emotion cues | Transparent lexicons for anger, anxiety, and satisfaction (binary per document) |
| Delay duration mentions | Regex-extracted delay/waiting durations (e.g. “delayed by 45 min”) |
| Cost mentions | Regex-extracted fares and amounts ($, £, €) |
| Passenger type (user_type) | Self-disclosed role: rail professional; daily commuter; rail enthusiast; tourist/occasional; skeptic/critic |
| Visibility | log(1 + parent post score) + log(1 + parent post comment count) |
| Operational Priority Index | Frequency × negativity × visibility, each max-normalized (Section 3.4) |
| Variable (dataset field) | Measurement |
|---|---|
| Service failure clusters (theme_clusters) | Lexicon match to seven clusters: Delay & Disruption; Crowding & Capacity; Ticketing & Refunds; Comfort & Cleanliness; Staff & Communication; Safety & Security; Accessibility (multi-label) |
| Matched terms (…_kw_matched) | Exact lexicon terms matched per cluster (audit trail for transparency) |
| Rail system context (rail_context) | USA, UK, Continental Europe, Asia-Pacific; high-speed, commuter/urban, sleeper/night, intercity (multi-label) |
| Operator mentions (operators_mentioned) | Named operators (e.g. Amtrak, ÖBB, SNCF, Eurostar, LNER) via alias dictionaries |
| Service dimensions (service_dimensions) | Nine target dimensions for dimension-level sentiment: reliability/punctuality; crowding; ticketing/fares; comfort/cleanliness; food & catering; staff & communication; safety & security; accessibility; information systems |
| Sentiment valence | VADER compound score in [−1, 1]; negative-token proportion; categorical label (positive ≥0.05, negative ≤ −0.05, neutral otherwise) |
| Emotion cues | Transparent lexicons for anger, anxiety, and satisfaction (binary per document) |
| Delay duration mentions | Regex-extracted delay/waiting durations (e.g. “delayed by 45 min”) |
| Cost mentions | Regex-extracted fares and amounts ($, £, €) |
| Passenger type (user_type) | Self-disclosed role: rail professional; daily commuter; rail enthusiast; tourist/occasional; skeptic/critic |
| Visibility | log(1 + parent post score) + log(1 + parent post comment count) |
| Operational Priority Index | Frequency × negativity × visibility, each max-normalized ( |
Sharing content requires targeting cookies to be enabled. Please update your cookie preferences to use this feature.