Databricks Reference
Reference material for Databricks Publishing -- data type mappings, CLI arguments, and querying.
Data Type Mapping
Source types map automatically to Databricks-compatible types. LakeXpress exports through Parquet, so the mapping is driven by the normalized source type name.
Pick your source database:
- PostgreSQL
- SQL Server
- Oracle
- Teradata
- MySQL
- MariaDB
- SAP HANA
PostgreSQL to Databricks
| PostgreSQL Type | Databricks Type |
|---|---|
SMALLINT | SMALLINT |
INTEGER, INT4 | INT |
BIGINT, INT8 | BIGINT |
NUMERIC(p,s) | DECIMAL(p,s) |
REAL, FLOAT4 | FLOAT |
DOUBLE PRECISION, FLOAT8 | DOUBLE |
VARCHAR(n) | VARCHAR(n) |
TEXT, TIME, UUID, JSON, JSONB, array [] | STRING |
CHAR(n) | CHAR(n) |
BOOLEAN | BOOLEAN |
DATE | DATE |
TIMESTAMP | TIMESTAMP_NTZ |
TIMESTAMPTZ | TIMESTAMP |
BYTEA | BINARY |
SQL Server to Databricks
| SQL Server Type | Databricks Type |
|---|---|
TINYINT | TINYINT |
SMALLINT | SMALLINT |
INT | INT |
BIGINT | BIGINT |
DECIMAL(p,s) | DECIMAL(p,s) |
MONEY | DECIMAL(19,4) |
SMALLMONEY | DECIMAL(10,4) |
FLOAT | DOUBLE |
REAL | FLOAT |
BIT | BOOLEAN |
VARCHAR(n), NVARCHAR(n) | VARCHAR(n) |
CHAR(n), NCHAR(n) | CHAR(n) |
TEXT, NTEXT, UNIQUEIDENTIFIER | STRING |
DATE | DATE |
DATETIME, DATETIME2, SMALLDATETIME | TIMESTAMP_NTZ |
DATETIMEOFFSET | TIMESTAMP |
VARBINARY | BINARY |
Oracle to Databricks
| Oracle Type | Databricks Type |
|---|---|
NUMBER | DECIMAL(38,18) |
NUMBER(p,s) | DECIMAL(p,s) |
FLOAT | DOUBLE |
VARCHAR2(n), NVARCHAR2(n) | VARCHAR(n) |
CHAR(n) | CHAR(n) |
CLOB, NCLOB | STRING |
DATE | DATE |
TIMESTAMP | TIMESTAMP_NTZ |
RAW, BLOB | BINARY |
Teradata to Databricks
| Teradata Type | Databricks Type |
|---|---|
BYTEINT, CLOB, TIME, VARBYTE | STRING |
SMALLINT | SMALLINT |
INTEGER | INT |
BIGINT | BIGINT |
DECIMAL(p,s), NUMERIC(p,s) | DECIMAL(p,s) |
NUMBER | DECIMAL(38,18) |
FLOAT, REAL | DOUBLE |
VARCHAR(n) | VARCHAR(n) |
CHAR(n) | CHAR(n) |
DATE | DATE |
TIMESTAMP | TIMESTAMP_NTZ |
BYTE, BLOB | BINARY |
MySQL to Databricks
| MySQL Type | Databricks Type |
|---|---|
TINYINT | TINYINT |
SMALLINT, YEAR | SMALLINT |
MEDIUMINT, INT | INT |
BIGINT | BIGINT |
DECIMAL(p,s) | DECIMAL(p,s) |
FLOAT, DOUBLE | DOUBLE |
BIT | BOOLEAN |
VARCHAR(n) | VARCHAR(n) |
CHAR(n) | CHAR(n) |
TINYTEXT, TEXT, MEDIUMTEXT, LONGTEXT, ENUM, SET, TIME, JSON | STRING |
DATE | DATE |
DATETIME, TIMESTAMP | TIMESTAMP_NTZ |
BINARY, VARBINARY, BLOB, TINYBLOB, MEDIUMBLOB, LONGBLOB | BINARY |
MariaDB to Databricks
| MariaDB Type | Databricks Type |
|---|---|
TINYINT | TINYINT |
SMALLINT, YEAR | SMALLINT |
MEDIUMINT, INT | INT |
BIGINT | BIGINT |
DECIMAL(p,s) | DECIMAL(p,s) |
FLOAT, DOUBLE | DOUBLE |
BIT | BOOLEAN |
VARCHAR(n) | VARCHAR(n) |
CHAR(n) | CHAR(n) |
TINYTEXT, TEXT, MEDIUMTEXT, LONGTEXT, ENUM, SET, TIME, JSON | STRING |
DATE | DATE |
DATETIME, TIMESTAMP | TIMESTAMP_NTZ |
BINARY, VARBINARY, BLOB, TINYBLOB, MEDIUMBLOB, LONGBLOB | BINARY |
SAP HANA to Databricks
| SAP HANA Type | Databricks Type |
|---|---|
TINYINT | TINYINT |
SMALLINT | SMALLINT |
INTEGER | INT |
BIGINT | BIGINT |
DECIMAL(p,s) | DECIMAL(p,s) |
SMALLDECIMAL, CLOB, NCLOB, TEXT, TIME, SECONDDATE | STRING |
REAL | FLOAT |
DOUBLE | DOUBLE |
BOOLEAN | BOOLEAN |
VARCHAR(n), NVARCHAR(n) | VARCHAR(n) |
CHAR(n), NCHAR(n) | CHAR(n) |
DATE | DATE |
TIMESTAMP | TIMESTAMP_NTZ |
VARBINARY, BLOB | BINARY |
CLI Reference
Databricks Publishing Arguments
| Option | Type | Description |
|---|---|---|
--publish_target ID | String | Credential ID for Databricks publishing (required) |
--publish_schema_pattern PATTERN | String | Schema naming pattern (default: EXT_{schema} for external, {schema} for internal) |
--publish_table_pattern PATTERN | String | Table naming pattern (default: {table}) |
--publish_method {external,internal} | Enum | external (Unity Catalog external table) or internal (managed Delta table) (default: external) |
--pk_constraints | Flag | Add PRIMARY KEY constraints (managed/Delta tables only) |
--n_jobs N | Integer | Parallel workers for table creation (default: 1) |
There is no --databricks_catalog flag. The target catalog is always taken from the catalog field of the Databricks credential in credentials.json.
Deprecated / Renamed Arguments
| Old Argument | Current Argument | Notes |
|---|---|---|
--databricks_table_type | --publish_method {external|internal} | Renamed to the generic, cross-platform flag (internal maps to managed for Databricks) |
--databricks_catalog | (none) | Never implemented as a CLI flag; the catalog comes from credentials only |
Querying Tables
Databricks SQL:
SELECT * FROM lakexpress_catalog.tpch_1.customer LIMIT 10;
Databricks Notebooks (Python):
df = spark.table("lakexpress_catalog.tpch_1.customer")
df.display()
Databricks Notebooks (SQL):
%sql
SELECT * FROM lakexpress_catalog.tpch_1.customer LIMIT 10
Delta Table Features (Managed Tables Only)
Time Travel:
SELECT * FROM lakexpress_catalog.tpch_1.customer VERSION AS OF 1;
Table History:
DESCRIBE HISTORY lakexpress_catalog.tpch_1.customer;
Optimize:
OPTIMIZE lakexpress_catalog.tpch_1.customer;
See Also
- Databricks Publishing - Setup and usage guide
- CLI Reference - All command-line options