SAVRN
Search Contact SAVRN

Dataset · Speech recognition

dhravani-iitdelhi-test

by Shrikant Nayak shrikanth-19/dhravani-iitdelhi-test

Check out the configuration reference at https://huggingface.co/docs/hub/spaces-config-reference A web-based interface for preparing audio datasets to fine-tune OpenAI's Whisper model.

Rows36
Configurations4
Size12.8 MB
Licensecc-by-4.0
AccessPublicly accessible
Monthly Downloads62

Dataset Card

By Shrikant Nayak, published under cc-by-4.0, revision 0fa0e8577eba.

Check out the configuration reference at https://huggingface.co/docs/hub/spaces-config-reference

Dataset Preparation Interface for Fine-tuning Whisper

A web-based interface for preparing audio datasets to fine-tune OpenAI's Whisper model. This tool helps in recording, managing, and organizing voice recordings with their corresponding transcriptions, with support for cloud storage and authentication.

Features

  • User authentication via Pocketbase
  • Cloud storage support (Hugging Face Datasets)
  • Multi-language support with native names
  • Modern Material Design recording interface
  • CSV transcript file support
  • Session-based recording workflow
  • Advanced recording controls
  • ⌨ Keyboard shortcuts for efficiency
  • Progress tracking and navigation
  • Local and cloud metadata management
  • Responsive, mobile-friendly UI

Getting Started

  1. Create a transcript CSV file with your content:
transcript
"First sentence to record"
"Second sentence to record"
# For multi-language support:
transcript_en,transcript_es
"English sentence","Spanish sentence"
  1. Start the Flask application:
python app.py
  1. Access the interface:
http://localhost:5000

Usage

  1. Authentication
  • Sign in using your Google account 2. Session Setup

  • Upload your transcript CSV

  • Select language and recording location
  • Enter speaker details
  • Click "Start Session" 3. Recording

  • Use on-screen controls or keyboard shortcuts:

    • R: Start recording / Stop recording
    • Space: Play recording
    • Enter: Save recording
    • Backspace: Re-record
    • : Previous transcript
    • : Skip current
  • Navigate using row numbers
  • Adjust transcript font size as needed

Data Storage

Recordings are stored in language-specific directories:

  • Storage:

datasets/ ├── en/ │ ├── audio/ │ │ ├── {user_prefix}_{YYYYMMDD_HHMMSS}.wav │ │ └── ... │ └── en.parquet # English recordings metadata ├── es/ │ ├── audio/ │ │ ├── {user_prefix}_{YYYYMMDD_HHMMSS}.wav │ │ └── ... │ └── es.parquet # Spanish recordings metadata │

Technical Details

Audio Recording

  • Browser Recording Format: 48kHz mono WebM
  • Storage Format: 16bit mono WAV
  • Maximum Duration: 30 seconds
  • Audio Processing: WebM -> WAV conversion with sample rate adjustment
  • Channels: 1 (mono)

Data Management

  • Metadata Organization:
  • stats.json: Global recording statistics
  • {language_code}.parquet: Language-specific metadata files
  • File Naming: {user_id_prefix}_{YYYYMMDD_HHMMSS}.{format}
  • Unicode Handling: NFC normalization for text

Authentication

  • Provider: Pocketbase with Google OAuth
  • Session Management: Server-side Flask sessions

Languages

  • Support: 74 languages with native names
  • Codes: ISO 639-1 standard
  • CSV Format:
  • Single language: transcript column
  • Multi-language: transcript_${lang_code} columns

Upload Management

  • Queue System: Background worker thread
  • Status Tracking: Real-time upload status polling
  • Error Handling: Automatic retries with timeout
  • Progress Updates: Toast notifications
  • Temporary Storage: ./temp folder for conversions

Frontend Features

  • Keyboard Shortcuts: Recording and navigation
  • Real-time Status: Progress tracking and notifications

Security

  • Authentication Required: All routes except static/login
  • File Validation: MIME type and extension checking
  • Secure Context: HTTPS recommended

Performance

  • Upload Queue: Asynchronous processing
  • Audio Conversion: Server-side processing
  • Session Caching: Browser storage optimization
  • Progress Tracking: Real-time websocket updates

Browser Support

  • Chrome (recommended)
  • Brave
  • Edge
  • Safari

Known Limitations

  • Requires microphone permissions
  • Internet connection needed
  • Maximum recording duration: 30 seconds
  • File size limits based on storage backend

Structure

gu 17 rows

SplitRowsSize
train173.2 MB
user_idstringfile_namestringtranscriptionstringspeaker_namestringaudioAudiosampling_rateint64durationfloat64genderstringcountrystringstatestringcitystringstatusstringverified_bystringageint64accentstringmother_tonguestringuser_infostring

ks 2 rows

SplitRowsSize
train2298.2 KB
user_idstringfile_namestringtranscriptionstringspeaker_namestringaudioAudiosampling_rateint64durationfloat64genderstringcountrystringstatestringcitystringstatusstringverified_bystringageint64accentstringmother_tonguestringuser_infostring

mr 7 rows

SplitRowsSize
train71.4 MB
file_namestringuser_idstringtranscriptionstringspeaker_namestringaudioAudiosampling_rateint64durationfloat64genderstringcountrystringstatestringcitystringstatusstringverified_bystringageint64accentstringmother_tonguestringuser_infostring

te 10 rows

SplitRowsSize
train1011.6 MB
file_namestringuser_idstringtranscriptionstringspeaker_namestringaudioAudiosampling_rateint64durationfloat64genderstringcountrystringstatestringcitystringstatusstringverified_bystringageint64accentstringmother_tonguestringuser_infostring

Details

Repository
shrikanth-19/dhravani-iitdelhi-test
Publisher
Shrikant Nayak
Task category
Speech recognition
Tags
Not stated by the source
Size category
Not stated by the source
Languages
gu, ks, mr, te
Revision
0fa0e8577eba5048267b6b22167db0fd65a62117
Last updated
2026-09-18

Files

6 files, 12.8 MB in total.

Data4 files · 12.8 MB
Documentation1 file · 4.6 KB
Repository1 file · 2.5 KB
Every file
FileTypeSizeSHA-256
gu/gu.parquetData2.5 MB1f5b58136930
ks/ks.parquetData242.4 KBff23dde5ed03
mr/mr.parquetData608.4 KBc4d28fb3594e
te/te.parquetData9.5 MBd2cf4f5b4f63
README.mdDocumentation4.6 KB
.gitattributesRepository2.5 KB

License and Download

License
cc-by-4.0
Access
No access gate
Download from Shrikant Nayak

Released by Shrikant Nayak through its official repository on Hugging Face. Read the license.