summaryrefslogtreecommitdiff
path: root/src/main/java/no/eliashaugsbakk/kompilator/tokenization/Lexer.java
blob: 4149b4f6b6c151c4c303a1b3af7399f1f36a2f99 (plain)
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
package no.eliashaugsbakk.kompilator.tokenization;

import static java.lang.Character.isLetterOrDigit;
import static no.eliashaugsbakk.kompilator.tokenization.LexerState.IN_STRING;
import static no.eliashaugsbakk.kompilator.tokenization.LexerState.IN_WORD;
import static no.eliashaugsbakk.kompilator.tokenization.LexerState.NORMAL;
import static no.eliashaugsbakk.kompilator.tokenization.TokenType.EOF;
import static no.eliashaugsbakk.kompilator.tokenization.TokenType.IDENTIFIER;
import static no.eliashaugsbakk.kompilator.tokenization.TokenType.KEYWORD;
import static no.eliashaugsbakk.kompilator.tokenization.TokenType.LPAREN;
import static no.eliashaugsbakk.kompilator.tokenization.TokenType.RPAREN;
import static no.eliashaugsbakk.kompilator.tokenization.TokenType.SEMICOLON;
import static no.eliashaugsbakk.kompilator.tokenization.TokenType.STRING;

import java.util.ArrayList;
import java.util.List;

public class Lexer {
  private int line = 1;
  private int column = 0;

  private final String input;
  private int position = 0;
  private final List<Token> tokens = new ArrayList<>();
  private final StringBuilder wordBuffer = new StringBuilder();
  LexerState state = NORMAL;


  public Lexer(String input) {
    this.input = input;
  }

  List<Token> tokenize() {

    while (position < input.length()) {
      char current = input.charAt(position);

      if (current == '\n') {
        line++;
        column = 0;
      } else {
        column++;
      }

      if (state == IN_WORD) {
        if (!isLetterOrDigit(current) || Character.isWhitespace(current)) {
          state = NORMAL;
          characterizeWord();
        } else {
          wordBuffer.append(current);
        }
      }
      if (state == NORMAL) {
        if (!Character.isWhitespace(current)) {
          if (current == '"') {
            state = IN_STRING;
          } else if (isLetterOrDigit(current)) {
            state = IN_WORD;
            wordBuffer.append(current);

          } else if (current == '(') {
            tokens.add(new Token(LPAREN, Character.toString(current), line, column));
          } else if (current == ')') {
            tokens.add(new Token(RPAREN, Character.toString(current), line, column));
          } else if (current == ';') {
            tokens.add(new Token(SEMICOLON, Character.toString(current), line, column));
          }
        }

      } else if (state == IN_STRING) {
        if (current == '"') {
          state = NORMAL;
          tokens.add(new Token(STRING, wordBuffer.toString(), line, column));
          wordBuffer.delete(0, wordBuffer.length());
        } else {
          wordBuffer.append(current);
        }
      }
      position++;
    }
    tokens.add(new Token(EOF, "End of File", line, column));
    return tokens;
  }

  private void characterizeWord() {
    if (Keywords.KEYWORDS.contains(wordBuffer.toString())) {
      tokens.add(new Token(KEYWORD, wordBuffer.toString(), line, column - wordBuffer.length()));
    } else {
      tokens.add(new Token(IDENTIFIER, wordBuffer.toString(), line, column - wordBuffer.length()));
    }
    wordBuffer.delete(0, wordBuffer.length());
  }
}