Speech Dataset

English Dataset

61 licensable sets · 12 dataset types · 12 countries

61 licensable English speech sets: 217,795 hours across 12 dataset types, sampled at 8–44 kHz in dual, mono and mixed mono/stereo channel.

English Dataset

Overview

  • LanguageEnglish
  • Dataset TypesAudiobook, Call-Center, Dictation, General Conversation, Medical, Monologue, Podcast, Scripted Monologue, Singing Audio, Spontaneous Dialogue, TTS, Utterance
  • CountryUnited States, Australia, United Kingdom, India, Canada, Abkhazia, Ireland, New Zealand, Singapore, South Africa, Philippines, Pakistan

Dataset Highlights

  • LanguageEnglish
  • Sample Rate16 kHz / 24 kHz / 44 kHz / 8 kHz
  • Total Hours217,795 hrs
  • ChannelsDual / Mono / Mono & Stereo (mixed)
Available sets

What you can license today

Volumes are as reported by the sourcing partner; confirmed at scoping. Pricing is quoted per audio hour.

Language & Accent · CountryDataset TypeVolumeAudio ChannelAudio Frequency
EnglishUnited StatesAudiobooks, Courses & Podcasts (Audio)650,000+ hours——
EnglishUnited StatesBroadcast Programs & Airchecks (Audio)490,000 hours——
EnglishUnited StatesCall Centre (real)100,000 hoursDual8 kHz
EnglishUnited StatesCall Centre (real)19,500 hoursMono & Stereo (mixed)8 kHz
EnglishIndia / United StatesCall Centre (real)13,000 hoursMono & Stereo (mixed)8 kHz
English (American)United StatesCall Centre (real)10,000 hoursDual8 kHz
English (Filipino agent / US customer)PhilippinesCall Centre (real)2,000 hoursMono8 kHz
English (Indian agent / US customer)IndiaCall Centre (real)2,000 hoursDual8 kHz
EnglishUnited StatesCall Centre (real)1,000+ hoursMono8 kHz
English (Indian agent / Australian customer)India / AustraliaCall Centre (real)450 hoursMono8 kHz
English (Filipino agent / US customer)Philippines / United StatesCall Centre (real)300 hoursMono8 kHz
EnglishUnited StatesCall Centre (real)300 hoursDual8 kHz
EnglishIndiaCall Centre (real)300 hoursMono8 kHz
EnglishPakistanCall Centre (real)300 hoursMono8 kHz
EnglishPhilippinesCall Centre (real)300 hoursMono8 kHz
English (American)United StatesCall Centre (real)200 hoursMono8 kHz
EnglishUnited StatesCall Centre (real)200 hoursMono & Stereo (mixed)8 kHz
English (Filipino agent / US customer)Philippines / United StatesCall Centre (real)100 hoursMono8 kHz
English (American)United StatesCall Centre (real)80 hoursMono8 kHz
EnglishUnited StatesCall Centre (simulated)1,200 hoursDual16 kHz
EnglishUnited States / globalConversational Audio (native + non-native)6,700 hoursDual8 kHz
English (American)United StatesDictation1,200 hoursMono8 kHz
English (American)United StatesDoctor-Patient Conversation200 hoursMonoMixed
English (British)United KingdomGeneral Conversation5,000 hoursMono24 kHz
English (American)United StatesGeneral Conversation2,700 hoursDual24 kHz+
EnglishUnited StatesGeneral Conversation2,500 hoursMono16 kHz
English (British)United KingdomGeneral Conversation2,500 hoursMono16 kHz+
English (American)United StatesGeneral Conversation2,500 hoursMono16 kHz+
English (Indian)IndiaGeneral Conversation1,700 hoursDual24 kHz+
English (British)United KingdomGeneral Conversation1,100 hoursDual24 kHz+
EnglishGeneral Conversation1,000+ hours——
English (Canadian)CanadaGeneral Conversation800 hoursDual24 kHz+
English (Australian)AustraliaGeneral Conversation650 hoursDual24 kHz+
EnglishSouth AfricaGeneral Conversation80 hoursMono16 kHz
EnglishAustraliaGeneral Conversation75 hoursMono16 kHz
EnglishNew ZealandGeneral Conversation75 hoursMono16 kHz
EnglishAbkhaziaGeneral Conversation70 hoursMono16 kHz
EnglishSingaporeGeneral Conversation70 hoursMono16 kHz
EnglishIndiaGeneral Conversation65 hoursMono16 kHz
EnglishUnited StatesGeneral Conversation50 hoursDual16 kHz
EnglishUnited KingdomGeneral Conversation45 hoursMono16 kHz
EnglishIrelandGeneral Conversation20 hoursMono16 kHz
EnglishGeneral Conversation15 hoursMono16 kHz
EnglishUnited StatesMonologue5,000 hoursMono8 kHz+
English (British)United KingdomMonologue5,000 hoursMono16 kHz+
English (American)United StatesMonologue5,000 hoursMonoMixed
EnglishUnited StatesMonologue2,000 hoursMono16 kHz+
EnglishUnited StatesPhysician Dictation950 hoursMono24 kHz+
EnglishUnited StatesPublished Podcasts (Audio)5,000 hours——
EnglishUnited StatesPublished Showcasts (Audio)8,500 hours——
English (British)United KingdomScripted Monologue5,000 hoursMono16 kHz+
English (Australian)AustraliaScripted Monologue1,500 hoursMono16 kHz+
EnglishUnited StatesScripted Monologue1,100 hoursMono16 kHz+
English (American)United StatesScripted Monologue1,100 hoursMono44 kHz+
English (American)United StatesScripted Monologue1,000 hoursMono44 kHz+
EnglishUnited StatesScripted Monologue (studio)1,000 hoursMono44 kHz+
EnglishUnited StatesSongs125,000 tracksMono24 kHz+
EnglishUnited StatesSongs5,000 hoursMonoMixed
English (American)United StatesTTS1,600 hoursMono44 kHz
English (Australian)AustraliaUtterance1,100 hoursMono16 kHz+
English (British)United KingdomUtterance1,100 hoursMono44 kHz

Use Cases

  • ASR (Automatic Speech Recognition)
  • Conversational AI
  • TTS (Text-to-Speech)
  • Call-Centre & Speech Analytics
  • Voice Assistants & Command Recognition
  • Healthcare & Clinical ASR
  • Language Modelling

Key Benefits

  • Diverse & RepresentativeBroad speaker coverage for inclusive, real-world AI.
  • High-Quality AudioClean, balanced recordings for reliable model performance.
  • Ready for AI/MLStructured and annotated for seamless integration.
  • Scalable & FlexibleMultiple durations, speakers, and domains to fit your needs.

Featured Clients

Trusted by leading AI teams and enterprises worldwide.

  • Microsoft
  • Amazon Web Services
  • Google

Can't find the English set you need?

Tell us the dataset type, volume and recording conditions — we scope custom collection in this language too.

  • This field is for validation purposes and should be left unchanged.
  • By registering, I agree with Shaip Privacy Policy and Terms of Service and provide my consent to receive B2B marketing communication from Shaip.