Subword tokenization with ## prefix
Token type IDs for sentence pairs
15% masking with 80-10-10 strategy
Binary classification pre-training task
[CLS] token extraction for classification
Adding task-specific heads