Table 2

Variables and operationalization

Variable (dataset field)Measurement
Service failure clusters (theme_clusters)Lexicon match to seven clusters: Delay & Disruption; Crowding & Capacity; Ticketing & Refunds; Comfort & Cleanliness; Staff & Communication; Safety & Security; Accessibility (multi-label)
Matched terms (…_kw_matched)Exact lexicon terms matched per cluster (audit trail for transparency)
Rail system context (rail_context)USA, UK, Continental Europe, Asia-Pacific; high-speed, commuter/urban, sleeper/night, intercity (multi-label)
Operator mentions (operators_mentioned)Named operators (e.g. Amtrak, ÖBB, SNCF, Eurostar, LNER) via alias dictionaries
Service dimensions (service_dimensions)Nine target dimensions for dimension-level sentiment: reliability/punctuality; crowding; ticketing/fares; comfort/cleanliness; food & catering; staff & communication; safety & security; accessibility; information systems
Sentiment valenceVADER compound score in [−1, 1]; negative-token proportion; categorical label (positive ≥0.05, negative ≤ −0.05, neutral otherwise)
Emotion cuesTransparent lexicons for anger, anxiety, and satisfaction (binary per document)
Delay duration mentionsRegex-extracted delay/waiting durations (e.g. “delayed by 45 min”)
Cost mentionsRegex-extracted fares and amounts ($, £, €)
Passenger type (user_type)Self-disclosed role: rail professional; daily commuter; rail enthusiast; tourist/occasional; skeptic/critic
Visibilitylog(1 + parent post score) + log(1 + parent post comment count)
Operational Priority IndexFrequency × negativity × visibility, each max-normalized (Section 3.4)
Source(s): Authors’ own work

or Create an Account

Close subscription notice
Close access options